Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,147

All topics
CardsList
  1. ConFit v3: Improving Resume-Job Matching with LLM-based Re-Ranking

    May 10, 2026Xiao Yu, Ruize Xu, Chengyuan Xue +6Reinforcement LearningLearning to Rank

  2. Trust Region Inverse Reinforcement Learning: Explicit Dual Ascent using Local Policy Updates

    May 10, 2026Anish Diwan, Davide Tateo, Christopher E. Mower +3Reinforcement LearningPolicy Optimization

  3. From Passive Reuse to Active Reasoning: Grounding Large Language Models for Neuro-Symbolic Experience Replay

    May 10, 2026Yanan Xiao, Yixiang Tang, Zechen Feng +3Reinforcement LearningExperience Replay

  4. Functional Graphs for Predicting and Explaining Goal Failure in Sparse Goal-Conditioned RL

    May 10, 2026Shalley DashReinforcement LearningSparse-Reward RL

  5. PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning

    May 10, 2026Dongyi Liu, Yifan Niu, Qinwen Wang +2Reinforcement LearningReward Shaping

  6. Learning the Preferences of a Learning Agent

    May 9, 2026Karim Abdel Sadek, Mark Bedaywi, Rhys Gould +1Reinforcement LearningPreference Learning

  7. DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation

    May 9, 2026Yang Zhou, Can Jin, Zihan Dong +7Reinforcement LearningRL for Language Model Reasoning

  8. Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs

    May 9, 2026Xiaozhe Li, Xinyu Fang, Shengyuan Ding +5RL BenchmarksReinforcement Learning

  9. Breaking the Impasse: Dual-Scale Evolutionary Policy Training for Social Language Agents

    May 9, 2026Minzheng Wang, Run Luo, Yanbo Wang +6Reinforcement LearningSelf-Play RL

  10. The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits

    May 9, 2026Tianhao Cheng, Zeyu Huang, Zihan Qiu +5Reinforcement LearningToken-Level Credit Assignment

  11. MARLaaS: Multi-Tenant Asynchronous Reinforcement Learning as a Service

    May 8, 2026Timothy Tin Long Yu, Gursimran Singh, Ge Shi +3Asynchronous RLReinforcement Learning

  12. DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards

    May 8, 2026Haoyu Hu, Xuandong Zhao, Xuhai "Orson'' Xu +1Reinforcement LearningGroup Relative Policy Optimization

  13. Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning

    May 8, 2026Manish Bhattarai, Ismael Boureima, Nishath Rajiv Ranasinghe +2Reinforcement LearningRL for Language Model Reasoning

  14. Reinforcement Learning for Exponential Utility: Algorithms and Convergence in Discounted MDPs

    May 8, 2026Gugan Thoppe, L. A. Prashanth, Ankur Naskar +1Markov Decision ProcessesReinforcement Learning

  15. Actor-Critic Algorithm for Dynamic Expectile and CVaR

    May 8, 2026Yudong Luo, Erick DelageReinforcement LearningRisk-Sensitive RL

  16. SEIF: Self-Evolving Reinforcement Learning for Instruction Following

    May 8, 2026Qingyu Ren, Qianyu He, Jiajie Zhu +7RL for Language ModelsReinforcement Learning

  17. RELO: Reinforcement Learning to Localize for Visual Object Tracking

    May 8, 2026Xin Chen, Chuanyu Sun, Jiao Xu +4Reinforcement LearningVisual Object Tracking

  18. Beyond Linear Attention: Softmax Transformers Implement In-Context Reinforcement Learning

    May 8, 2026Zixuan Xie, Xinyu Liu, Claire Chen +3Reinforcement LearningTransformer-Based RL

  19. Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models

    May 8, 2026Xiaoze Liu, Dhananjay Ram, Yuting Zhang +3RL for Language ModelsReinforcement Learning

  20. Improved Model-based Reinforcement Learning with Smooth Kernels

    May 8, 2026Kun Long, Yuqiang Li, Xianyi WuReinforcement LearningContinuous-Time RL

  21. Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR

    May 8, 2026Yash Ingle, Jaival Chauhan, Ankit Yadav +1Reinforcement LearningRL for Language Model Reasoning