Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Policy Complexity, Reaction Time, and Bounded Rationality in Reinforcement Learning

    Sep 23, 2026James Wu, Chris R. SimsComputational Cognitive ModelingReinforcement Learning

  2. RLVR landscapes for iterated multiplications can be benign: Insights from spin-glass theory

    Sep 23, 2026Noa Rubin, Zohar RingelReinforcement LearningMaximum Entropy RL

  3. RL Starts before RL: On Policy Distillation for Better Reinforcement Learning

    Sep 23, 2026Shuai Dong, Yongfu Zhu, Yuqi Xu +26Reinforcement LearningRL for Language Model Reasoning

  4. Curriculum Learning with GNN-based Reinforcement Learning for Job Shop Scheduling

    Sep 23, 2026Jayakrishnan K. Vasudevan, Jonathan Hoss, Noah KlarmannReinforcement LearningCurriculum RL

  5. Robust Adversarial Reinforcement Learning with Risk Sensitivity and Critic Consistency Regularization

    Sep 23, 2026Jiaxi Wu, Tiantian Zhang, Yuxing Wang +2Reinforcement LearningRisk-Sensitive RL

  6. DCRL: Decoupling and Coupling Reinforcement Learning via Policy-Reward Manifold Alignment

    Sep 23, 2026Henan Sun, Zehua Li, Haitao Hu +4Reinforcement LearningRL for Language Model Reasoning

  7. EBRL: Asynchronous Embodied RL by Multi-Grained Resource Management

    Sep 23, 2026Liang Mi, Weijun Wang, Bowen Gao +12Asynchronous RLReinforcement Learning

  8. Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms

    Sep 23, 2026Xinjie Shen, Wei Fan, Xudong Guo +5Agentic RLReinforcement Learning

  9. Turning Safety into Competence: Minimally Exploitable Robot Policies via Safety-Filtered Reinforcement Learning

    Sep 23, 2026Ruihan Wu, Rui Yang, Donggeon David Oh +2Sequential MARLRL for Robotics

  10. WTF?! Simulation-Free Reinforcement Learning with Wasserstein-Tilted Flow Maps

    Sep 22, 2026Abbas Mammadov, Jerry Y. Huang, Justin Lin +5Reinforcement LearningGenerative Flow Networks

  11. Rollout Efficiency in Reinforcement Learning for Reasoning Large Language Models: A Taxonomy and Future Directions

    Sep 21, 2026Niloofar Gholipour, Marcos Assuncao, Gursimran Singh +8LLM Inference EfficiencyReinforcement Learning

  12. Correcting Within-Group Self-Selection Bias in Prioritized Replay

    Sep 21, 2026Oscar Miró López-Feliu, Herke van HoofReinforcement LearningSample-Efficient RL

  13. Learning to Plan in Human-Robot Collaboration: Multimodal Reinforcement Learning for Adaptive Interaction

    Sep 21, 2026Afagh Mehri Shervedani, Siyu Li, Natawut Monaikul +3Reinforcement LearningRobotic RL

  14. Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use

    Sep 21, 2026Zixiang Chen, Wenting Zhao, Zhepeng Cen +9Reinforcement LearningCredit Assignment in RL

  15. Reinforcement Learning in Operational Research: A Technical Review and Practical Roadmap

    Sep 21, 2026Yahan Lu, Dongyang Xia, Nursen Aydin +1Reinforcement LearningSequential Decision Making

  16. Lifted Bellman Linear Programming for Offline Reinforcement Learning

    Sep 21, 2026Hyukjun Yang, Jongchan Park, Narim Jeong +1Reinforcement LearningOffline RL

  17. Information-Time Proximal Policy Optimization

    Sep 21, 2026Yongcheng Zeng, Xinyu Cui, Yan Song +9Reinforcement LearningRL for Language Model Reasoning

  18. Performance-Preserving Online Adaptation in Social Navigation via Diffusion Steering

    Sep 21, 2026Haruto Nagahisa, Kohei Matsumoto, Yuki Hyodo +1Robot Policy AdaptationReinforcement Learning

  19. MimicAgent: Quadruped Skills via Prompt-to-Trajectory Generation

    Sep 21, 2026Lucky Kant Nayak, Narayanan Palghat Parameswaran, Neehar Peri +1Reinforcement LearningTrajectory Generation

  20. Statistical Convergence of Transformer Encoder-Accelerated Robust Reinforcement Learning

    Sep 20, 2026Suman Banerjee, Hiroyasu TsukamotoReinforcement LearningTransformer-Based RL

  21. OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue

    Sep 18, 2026Haolin He, Yunfei Chu, Qi Chen +15Reinforcement LearningSynthetic Data Generation

  22. Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL

    Sep 17, 2026Juzheng Zhang, Disha Makhija, Manoj Ghuhan Arivazhagan +2Supervised Fine-TuningReinforcement Learning

  23. Model-based Bootstrap for Offline Policy Evaluation in Tabular Reinforcement Learning

    Sep 17, 2026Weiwei Wang, Yuqiang Li, Xianyi Wu +1Reinforcement LearningOff-Policy Evaluation

  24. GR2PO: Group Relative Return Policy Optimization for Continuous Robot Control

    Sep 17, 2026Pengqin Wang, Qiming Zhang, Shaojie Shen +1Reinforcement LearningGroup Relative Policy Optimization

  25. RLLBC-Lib: An Educational Code Library for Reinforcement Learning and Learning-Based Control

    Sep 16, 2026Bernd Frauenknecht, Emma Cramer, Artur Eisele +9RL ControlReinforcement Learning