Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. PlayTrain: An Efficient Reinforcement Learning Framework for LLM-Generated Adaptable JavaScript Games

    Sep 8, 2026Ryan Truong, Lance Ying, Samuel J. Gershman +1Reinforcement LearningGame-Playing Agents

  2. CAST: Alternating State-Value Targets and Expanded Policy Gradients for Model-Based Reinforcement Learning

    Sep 8, 2026Pietro Noah Crestaz, Mohamed Yassine Kabouri, Nicolas Mansard +1RL for RoboticsReinforcement Learning

  3. Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks

    Sep 8, 2026Hongbang Yuan, Zhuoran Jin, Yixin CaoReinforcement LearningSparse-Reward RL

  4. Routing Dense Layouts with History-Aware Offline Reinforcement Learning using LSTM

    Sep 8, 2026Afsara Khan, Austin RovinskiReinforcement LearningOffline RL

  5. CoER: Defending against Adaptive Indirect Prompt Injection via Adversarial Co-Evolution and Refinement

    Sep 7, 2026Boyang Zhang, Qingxin Xiao, Lingwei Dang +1Reinforcement LearningAI Agent Security

  6. Temporal-Causal Inference for Reinforcement Learning via Automata Learning

    Sep 7, 2026Jan Corazza, Daniil Kaminskyi, Simon Lutz +4Reinforcement LearningCausal RL

  7. Long-Horizon Language Model Reinforcement Learning via Progressive Point Matching

    Sep 7, 2026Preston Fu, Kevin Frans, Oleh Rybkin +2Reinforcement LearningReward Shaping

  8. CircuitLens: Reasoning Circuits as Data Selection Signals for Reinforcement Learning with Verifiable Rewards

    Sep 7, 2026Zhuofan Chen, Ziqian Jiao, Yikai Cui +3Numerical Reasoning in Language ModelsReinforcement Learning

  9. Stable-MM-R1: Anchoring Multimodal Reasoning Dynamics via Entropy-Guided Stratification

    Sep 7, 2026Yimeng Ye, Shuang Chen, Wenxuan Huang +8Reinforcement LearningRL Fine-Tuning

  10. SQL-Zero: Self-Evolving Text-to-SQL

    Sep 7, 2026Daniel Machado Pedrozo, Julia Soares Dollis, Bryan Lincoln Marques de Oliveira +3Reinforcement LearningSelf-Play RL

  11. SENTINEL-RL: Offloading Topological Reasoning from LLM Agents in the Security Operations Center

    Sep 3, 2026Uday Vallabhaneni, Cassie L. Cagwin, David J. WildReinforcement LearningCybersecurity

  12. Spurious Advantage Hidden in GRPO

    Sep 3, 2026Jiamian Wang, Samyadeep Basu, Koustava Goswami +2Reinforcement LearningGroup Relative Policy Optimization

  13. CROCODIL: Cross-Model Code Editing with LLMs

    Sep 3, 2026Linghan Zhong, Aditya Thimmaiah, Jayanth Srinivasa +2Reinforcement LearningLLM Post-Training

  14. Out-of-Distribution Generalisation with Sequence Models in Offline Multi-Agent Reinforcement Learning

    Sep 3, 2026Oussama Hidaoui, Omer Ebead, Ulrich Armel Mbou Sob +14Zero-Shot LearningReinforcement Learning

  15. A Comparative Study of Graph Representations for GNN-Based Power Grid Control in L2RPN

    Sep 2, 2026Adrian Degenkolb, Qiong Huang, Benjamin SchäferPower SystemsGraph Neural Networks

  16. NE-R1: Enhancing Named Entity Recognition Model via Reinforcement Learning

    Sep 2, 2026Meixuan Chen, Hehan Li, Ruizhi Zhao +8Named Entity RecognitionAdaptive RAG

  17. Recursive Value Learning for Long-Horizon Offline Goal-Conditioned RL

    Sep 2, 2026Hyeonseong Jeon, Youngwoon LeeReinforcement LearningOffline RL

  18. On-Policy Distillation Meets Off-Policy GRPO: Training Compact Instruction-Following Rerankers

    Sep 1, 2026Vignesh Prabhakar, Jialing Pan, Anil Babu AnkisettipalliReinforcement LearningLearning to Rank

  19. The Rise of Verbal Reinforcement Learning

    Sep 1, 2026Kshitij Tayal, Arun Sharma, Genta Indra Winata +2RL for Language ModelsReinforcement Learning

  20. Provably Safe Sim-to-Real Transfer

    Sep 1, 2026Tingting Ni, Maryam KamgarpourReinforcement LearningSim-to-Real Transfer

  21. CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMs

    Sep 1, 2026Chaohui Guo, Michel Klein, Zhisheng HuangReinforcement LearningLLM Inference Scheduling

  22. Reinforcement Learning and Rule-Based Peer-to-Peer Pricing in Residential PV-BES Communities

    Sep 1, 2026Pablo Benalcazar, Maciej Kalka, Wilian Guamán +1Reinforcement LearningDynamic Pricing

  23. Dense Process Supervision for Search Agents via Fact Utility Estimation

    Sep 1, 2026Rongzhi Zhu, Xiangyu Liu, Yi Liu +7Reinforcement LearningCredit Assignment in RL

  24. It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning

    Sep 1, 2026Runpeng Dai, Kaili Huang, Changsung Kang +1Reinforcement LearningGenerative Retrieval

  25. Independent Reinforcement Learning in Discounted Markov Games

    Sep 1, 2026Asrin Efe Yorulmaz, Ugur Aydin, Tamer BasarReinforcement LearningGame Theory

  26. Provably Efficient Federated Reinforcement Learning with Linear Function Approximation and Logarithmic Communication Cost

    Aug 31, 2026Zihang Liang, Haochen Zhang, Lingzhou XueReinforcement LearningFederated RL

  27. Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

    Aug 31, 2026Zhiqin Yang, Jingwen Fu, Yuhan Liu +16Reinforcement LearningRL for Language Model Reasoning