Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Exploring Pass-Rate Reward in Reinforcement Learning for Code Generation

    May 1, 2026Xin-Ye Li, Ren-Biao Liu, Yun-Ji Zhang +3RL for Code GenerationReinforcement Learning

  2. Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization

    May 1, 2026Yue Mao, Shicheng Liu, Siyuan Xu +1Reinforcement Learning

  3. Model-Based Reinforcement Learning with Double Oracle Efficiency in Policy Optimization and Offline Estimation

    May 1, 2026Haichen Hu, Jian Qian, David Simchi-LeviRegret Minimization in RLMarkov Decision Processes

  4. Interpretable experiential learning based on state history and global feedback

    May 1, 2026Anton KoloninReinforcement LearningGame-Playing Agents

  5. ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning

    May 1, 2026Zihan Lin, Xiaohan Wang, Jie Cao +6RL for Language ModelsReinforcement Learning

  6. Data Deletion Can Help in Adaptive RL

    Apr 30, 2026Param Budhraja, Aditya Gangrade, Alex Olshevsky +1Non-Stationary RLReinforcement Learning

  7. Pessimism-Free Offline Learning in General-Sum Games via KL Regularization

    Apr 30, 2026Claire Chen, Yuheng ZhangNash EquilibriumReinforcement Learning

  8. Wasserstein Distributionally Robust Regret Optimization for Reinforcement Learning from Human Feedback

    Apr 30, 2026Yikai Wang, Shang Liu, Jose BlanchetRegret Minimization in RLReinforcement Learning

  9. RHyVE: Competence-Aware Verification and Phase-Aware Deployment for LLM-Generated Reward Hypotheses

    Apr 30, 2026Feiyu Wu, Xu Zheng, Zhuocheng Wang +2Reinforcement LearningLLM-Guided RL

  10. Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning

    Apr 30, 2026Jingcheng Deng, Zihao Wei, Liang Pang +4Reinforcement LearningRL for Language Model Reasoning

  11. GUI Agents with Reinforcement Learning: Toward Digital Inhabitants

    Apr 30, 2026Junan Hu, Jian Liu, Jingxiang Lai +6Reinforcement LearningRL for GUI Agents

  12. Leveraging Verifier-Based Reinforcement Learning in Image Editing

    Apr 30, 2026Hanzhong Guo, Jie Wu, Jie Liu +6Reward ModelingReinforcement Learning

  13. PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations

    Apr 30, 2026Yang Zhang, Jiangyuan Zhao, Chenyou Fan +11Reinforcement LearningLong-Horizon Robotic Manipulation

  14. Continuous-time q-learning for mean-field control with common noise, part-II: q-learning algorithms

    Apr 30, 2026Zhenjie Ren, Xiaoli Wei, Xiang Yu +1Reinforcement LearningStochastic Optimal Control

  15. AutoREC: A reinforcement learning platform for equivalent circuit model generation

    Apr 29, 2026Ali Jaberi, Yonatan Kurniawan, Robert Black +5Reinforcement LearningSystem Identification

  16. Rule-based High-Level Coaching for Goal-Conditioned Reinforcement Learning in Search-and-Rescue UAV Missions Under Limited-Simulation Training

    Apr 29, 2026Mahya Ramezani, Holger VoosReinforcement LearningUAV Navigation

  17. FutureWorld: A Live Reinforcement Learning Environment for Predictive Agents with Real-World Outcome Rewards

    Apr 29, 2026Zhixin Han, Yanzhi Zhang, Chuyang Wei +11Agentic RLReinforcement Learning

  18. Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control

    Apr 29, 2026Bolian Li, Yifan Wang, Yi Ding +3RL for Language ModelsReinforcement Learning

  19. Sample-efficient Neuro-symbolic Proximal Policy Optimization

    Apr 28, 2026Simone Murari, Celeste Veronese, Daniele MeliReinforcement LearningProximal Policy Optimization

  20. Improving Zero-Shot Offline RL via Behavioral Task Sampling

    Apr 28, 2026Nazim Bendib, Nicolas Perrin-Gilbert, Olivier SigaudReinforcement LearningOffline RL

  21. Safe-Support Q-Learning: Learning without Unsafe Exploration

    Apr 28, 2026Yeeun Lim, Narim Jeong, Donghwan LeeReinforcement LearningKL-Regularized RL

  22. How Can Reinforcement Learning Achieve Expert-level Placement?

    Apr 28, 2026Ruo-Tong Chen, Ke Xue, Chengrui Gao +7Reinforcement LearningElectronic Design Automation

  23. Model-Aware Data Cleaning for Tabular Foundation Models

    Apr 28, 2026Laure Berti-EquilleTabular Foundation ModelsReinforcement Learning