Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO

    May 29, 2026Yiming Ren, Yiran Xu, Zicheng Lin +8Reinforcement LearningRL for Language Model Reasoning

  2. Efficient and Uncertainty-Aware Diffusion Framework for Offline-to-Online Reinforcement Learning

    May 29, 2026Ha Manh Bui, Metod Jazbec, Eric Nalisnick +1Reinforcement LearningDiffusion Policy

  3. Learning to Perceive the World Through Control: Empowerment-Based Representation Learning

    May 28, 2026Mahsa Bastankhah, Sophie Broderick, Benjamin EysenbachRepresentation LearningReinforcement Learning

  4. Uncertainty-Aware and Temporally Regulated Expert Advice in Reinforcement Learning for Autonomous Driving

    May 28, 2026Ahmed Abouelazm, Felix Klingebiel, Philip Schörner +1Reinforcement LearningRisk-Sensitive RL

  5. Physics-informed Goal-Conditioned Reinforcement Learning under Hybrid Contact Dynamics

    May 28, 2026Vittorio Giammarino, Anastasios Manganaris, Ahmed H. QureshiReinforcement LearningContact-Rich Robotic Manipulation

  6. Stable-Layers: Fine-Tuning Image Layer Decomposition Models with VLM-Scored Reinforcement Learning

    May 28, 2026Ciara Rowles, Reshinth Adithyan, Nikhil Pinnaparaju +2Reinforcement Learning

  7. Reinforcement Learning with Robust Rubric Rewards

    May 28, 2026Ya-Qi Yu, Hao Wang, Fangyu Hong +15Reinforcement LearningRubric-Based RL

  8. On Distributional Reinforcement Learning in Chaotic Dynamical Systems

    May 28, 2026James Rudd-Jones, Mirco Musolesi, María Pérez-OrtizDistributional RLReinforcement Learning

  9. LLM-Guided Future Hypotheses for Horizon-Aware Exploration in Multi-Step Robot Manipulation

    May 28, 2026Mohammad Khoshnazar, Andrew Melnik, Michael BeetzRL for RoboticsReinforcement Learning

  10. ESPO: Early-Stopping Proximal Policy Optimization

    May 28, 2026Zihang Li, Rui Zhou, Yingcheng Shi +8Early StoppingReinforcement Learning

  11. EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation

    May 28, 2026Xin Guan, Xiaomeng Hu, Shen Huang +6Open-Ended GenerationRL for Language Models

  12. Momentum Based Reward Design for Low Emission Traffic Signal Control

    May 28, 2026Chinmay Mundane, Amith Manoharan, Arun Kumar SinghReinforcement LearningReward Shaping

  13. DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning

    May 28, 2026Yang He, Xiao Ding, Bibo Cai +5Reinforcement LearningRL for Language Model Reasoning

  14. Prompt-Level Reward Specifications for Open-Ended Post-Training

    May 28, 2026Zijun Weng, Xiaohui Hu, Shuangyong Song +3Open-Ended GenerationReward Modeling

  15. PRO-CUA: Process-Reward Optimization for Computer Use Agents

    May 27, 2026Yifei He, Rui Yang, Hao Bai +2Reinforcement LearningProcess Reward Models

  16. Label-Free Reinforcement Learning via Cross-Model Entropy

    May 27, 2026Matt Gorbett, Hossein ShiraziReinforcement LearningInstruction Following

  17. Optimal Data Acquisition for Reinforcement Learning: A Large Deviations Perspective

    May 27, 2026Mingjie Hu, Jian-Qiang Hu, Enlu ZhouReinforcement LearningSample-Efficient RL

  18. Soft-SVeRL: Self-Verified Reinforcement Learning with Soft Rewards

    May 27, 2026Saurabh Dash, Pierre Clavier, John Dang +4Reinforcement LearningInstruction Following

  19. Mechanistically Interpreting the Role of Sample Difficulty in RLVR for LLMs

    May 27, 2026Yue Cheng, Jiajun Zhang, Xiaohui Gao +3Reinforcement LearningRL for Language Model Reasoning

  20. Variance-Adaptive Optimal Algorithm for Reinforcement Learning with Multinomial Logit Function Approximation

    May 27, 2026Wonyoung Kim, Min-Hwan Oh, Garud Iyengar +1Regret Minimization in RLReinforcement Learning

  21. Commit to the Bit: Reactive Reinforcement Learning Done Right

    May 27, 2026Onno Eberhard, Claire Vernade, Michael MuehlebachReinforcement LearningPartially Observable RL

  22. IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage

    May 27, 2026Yuhan Li, Mingxu Zhang, Dazhong Shen +1Reinforcement LearningRL for Language Model Reasoning

  23. Off-Policy Learning to Reason Works Because It Is More Pessimistic Than You Think

    May 27, 2026Otmane Sakhi, Aleksei Arzhantsev, Imad Aouali +1Reinforcement LearningRL for Language Model Reasoning

  24. Cyclical Entropy Eruption: Entropy Dynamics in Agent Reinforcement Learning

    May 27, 2026Wendi Li, Shawn Im, Sharon LiAgentic RLReinforcement Learning