Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. A Bellman Optimality Equation for Plasticity

    Sep 11, 2026Jeremy Lucas, Doina PrecupStability-Plasticity DilemmaReinforcement Learning

  2. From Connectivity to Rewards: Dense Reward Learning with Directed State Graphs

    Sep 11, 2026Shuyuan Zhang, Zihan Wang, Xiao-Wen Chang +1Reinforcement LearningHierarchical RL

  3. Near-Optimal Reinforcement Learning with Multi-Step Transition Lookahead

    Sep 10, 2026Corentin Pla, Hugo Richard, Marc Abeille +1Reinforcement LearningApproximation Algorithms

  4. InstantMimic: A High Performance System for Learning Physics-based Skills in Seconds

    Sep 9, 2026Ikjun Choi, Geonho Leem, Jungdam WonReinforcement LearningImitation Learning

  5. PlayTrain: An Efficient Reinforcement Learning Framework for LLM-Generated Adaptable JavaScript Games

    Sep 8, 2026Ryan Truong, Lance Ying, Samuel J. Gershman +1Reinforcement LearningGame-Playing Agents

  6. CAST: Alternating State-Value Targets and Expanded Policy Gradients for Model-Based Reinforcement Learning

    Sep 8, 2026Pietro Noah Crestaz, Mohamed Yassine Kabouri, Nicolas Mansard +1RL for RoboticsReinforcement Learning

  7. Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks

    Sep 8, 2026Hongbang Yuan, Zhuoran Jin, Yixin CaoReinforcement LearningSparse-Reward RL

  8. Routing Dense Layouts with History-Aware Offline Reinforcement Learning using LSTM

    Sep 8, 2026Afsara Khan, Austin RovinskiReinforcement LearningOffline RL

  9. CoER: Defending against Adaptive Indirect Prompt Injection via Adversarial Co-Evolution and Refinement

    Sep 7, 2026Boyang Zhang, Qingxin Xiao, Lingwei Dang +1Reinforcement LearningAI Agent Security

  10. Temporal-Causal Inference for Reinforcement Learning via Automata Learning

    Sep 7, 2026Jan Corazza, Daniil Kaminskyi, Simon Lutz +4Reinforcement LearningCausal RL

  11. Long-Horizon Language Model Reinforcement Learning via Progressive Point Matching

    Sep 7, 2026Preston Fu, Kevin Frans, Oleh Rybkin +2Reinforcement LearningReward Shaping

  12. CircuitLens: Reasoning Circuits as Data Selection Signals for Reinforcement Learning with Verifiable Rewards

    Sep 7, 2026Zhuofan Chen, Ziqian Jiao, Yikai Cui +3Numerical Reasoning in Language ModelsReinforcement Learning

  13. Stable-MM-R1: Anchoring Multimodal Reasoning Dynamics via Entropy-Guided Stratification

    Sep 7, 2026Yimeng Ye, Shuang Chen, Wenxuan Huang +8Reinforcement LearningRL Fine-Tuning

  14. SQL-Zero: Self-Evolving Text-to-SQL

    Sep 7, 2026Daniel Machado Pedrozo, Julia Soares Dollis, Bryan Lincoln Marques de Oliveira +3Reinforcement LearningSelf-Play RL

  15. SENTINEL-RL: Offloading Topological Reasoning from LLM Agents in the Security Operations Center

    Sep 3, 2026Uday Vallabhaneni, Cassie L. Cagwin, David J. WildReinforcement LearningCybersecurity

  16. Spurious Advantage Hidden in GRPO

    Sep 3, 2026Jiamian Wang, Samyadeep Basu, Koustava Goswami +2Reinforcement LearningGroup Relative Policy Optimization

  17. CROCODIL: Cross-Model Code Editing with LLMs

    Sep 3, 2026Linghan Zhong, Aditya Thimmaiah, Jayanth Srinivasa +2Reinforcement LearningLLM Post-Training

  18. Out-of-Distribution Generalisation with Sequence Models in Offline Multi-Agent Reinforcement Learning

    Sep 3, 2026Oussama Hidaoui, Omer Ebead, Ulrich Armel Mbou Sob +14Zero-Shot LearningReinforcement Learning

  19. A Comparative Study of Graph Representations for GNN-Based Power Grid Control in L2RPN

    Sep 2, 2026Adrian Degenkolb, Qiong Huang, Benjamin SchäferPower SystemsGraph Neural Networks

  20. NE-R1: Enhancing Named Entity Recognition Model via Reinforcement Learning

    Sep 2, 2026Meixuan Chen, Hehan Li, Ruizhi Zhao +8Named Entity RecognitionAdaptive RAG

  21. Recursive Value Learning for Long-Horizon Offline Goal-Conditioned RL

    Sep 2, 2026Hyeonseong Jeon, Youngwoon LeeReinforcement LearningOffline RL

  22. On-Policy Distillation Meets Off-Policy GRPO: Training Compact Instruction-Following Rerankers

    Sep 1, 2026Vignesh Prabhakar, Jialing Pan, Anil Babu AnkisettipalliReinforcement LearningLearning to Rank

  23. The Rise of Verbal Reinforcement Learning

    Sep 1, 2026Kshitij Tayal, Arun Sharma, Genta Indra Winata +2RL for Language ModelsReinforcement Learning