Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models

    Apr 27, 2026Dan Shi, Zhuowen Han, Simon Ostermann +3Reinforcement LearningRL for Language Model Reasoning

  2. asRoBallet: Closing the Sim2Real Gap via Friction-Aware Reinforcement Learning for Underactuated Spherical Dynamics

    Apr 27, 2026Fang Wan, Guangyi Huang, Tianyu Wu +5Humanoid Robot LocomotionReinforcement Learning

  3. Hierarchical Behaviour Spaces

    Apr 27, 2026Michael Tryfan Matthews, Anssi Kanervisto, Jakob Foerster +3Reinforcement LearningHierarchical RL

  4. A Reward-Free Viewpoint on Multi-Objective Reinforcement Learning

    Apr 27, 2026Ying-Tu Chen, Wei Hung, Bing-Shu Wu +2Multi-Objective Reinforcement LearningReinforcement Learning

  5. DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents

    Apr 27, 2026Junshuo Zhang, Chengrui Huang, Feng Guo +6Reinforcement LearningRL Exploration

  6. Model-Free Inference of Investor Preferences: A Relative Entropy IRL Approach

    Apr 27, 2026Chen XuReward ModelingReinforcement Learning

  7. Scalable Production Scheduling: Linear Complexity via Unified Homogeneous Graphs

    Apr 26, 2026Jonathan Hoss, Moritz Link, Noah KlarmannGraph Neural NetworksReinforcement Learning

  8. GIFT: Global stabilisation via Intrinsic Fine Tuning

    Apr 25, 2026Rory Young, Nicolas PugeaultRL ControlReinforcement Learning

  9. Preserve Support, Not Correspondence: Dynamic Routing for Offline Reinforcement Learning

    Apr 24, 2026Zhancun Mu, Guangyu Zhao, Yiwu Zhong +1Reinforcement LearningOffline RL

  10. Do Not Imitate, Reinforce: Iterative Classification via Belief Refinement

    Apr 23, 2026Mahdi Kallel, Johannes Tölle, Ahmed Hendawy +1Reinforcement LearningClassification

  11. Insect-inspired modular architectures as inductive biases for reinforcement learning

    Apr 23, 2026Anne E. StaplesRL ControlReinforcement Learning

  12. Replay-buffer engineering for noise-aware quantum circuit optimization

    Apr 23, 2026Akash Kundu, Sebastian FeldReinforcement LearningExperience Replay

  13. Task-specific Subnetwork Discovery in Reinforcement Learning for Autonomous Underwater Navigation

    Apr 23, 2026Yi-Ling Liu, Melvin Laux, Mariela De Lucas Alvarez +2Reinforcement LearningUnderwater Robotics

  14. Dynamical Priors as a Training Objective in Reinforcement Learning

    Apr 23, 2026Sukesh SubaharanReinforcement LearningPolicy Gradient Methods

  15. Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning

    Apr 23, 2026Yongcan Yu, Lingxiao He, Jian Liang +5Reinforcement LearningRL for Language Model Reasoning

  16. Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding

    Apr 23, 2026Wenkai Wang, Xiyun Li, Hongcan Guo +5Reinforcement LearningGUI Grounding

  17. Distributional Value Estimation Without Target Networks for Robust Quality-Diversity

    Apr 22, 2026Behrad Koohy, Jamie BayneDistributional RLReinforcement Learning

  18. Maximum Entropy Semi-Supervised Inverse Reinforcement Learning

    Apr 22, 2026Julien Audiffren, Michal Valko, Alessandro Lazaric +1Reinforcement LearningMaximum Entropy RL

  19. Efficient Reinforcement Learning using Linear Koopman Dynamics for Nonlinear Robotic Systems

    Apr 21, 2026Wenjian Hao, Yuxuan Fang, Zehui Lu +1Robotic ControlReinforcement Learning

  20. TEMPO: Scaling Test-time Training for Large Reasoning Models

    Apr 21, 2026Qingyang Zhang, Xinke Kong, Haitao Wu +7Reinforcement LearningInference-Time Optimization

  21. Intentional Updates for Streaming Reinforcement Learning

    Apr 21, 2026Arsalan Sharifnassab, Mohamed Elsayed, Kris De Asis +2Reinforcement LearningTemporal-Difference Learning

  22. Beyond Bellman: High-Order Generator Regression for Continuous-Time Policy Evaluation

    Apr 21, 2026Yaowei Zheng, Richong Zhang, Shenxi Wu +5Reinforcement LearningValue Function Estimation

  23. Curiosity-Critic: Cumulative Prediction Error Improvement as a Tractable Intrinsic Reward for World Model Training

    Apr 20, 2026Vin Bhaskara, Haicheng WangIntrinsic Reward MethodsReinforcement Learning

  24. Bounded Ratio Reinforcement Learning

    Apr 20, 2026Yunke Ao, Le Chen, Bruce D. Lee +5Reinforcement LearningGroup Relative Policy Optimization

  25. Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data

    Apr 20, 2026Zhenwen Liang, Yujun Zhou, Sidi Lu +3Reinforcement LearningRL for Language Model Reasoning

  26. Negative Advantages Is a Double-Edged Sword: Calibrating advantages in GRPO for Search Agents

    Apr 20, 2026Jiayi Wu, Ruobing Xie, Zeqian Huang +6Reinforcement LearningRL for Language Model Reasoning