Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Towards Robust LLM Post-Training: Automatic Failure Management for Reinforcement Fine-Tuning

    May 6, 2026Lingzhe Zhang, Tong Jia, Yunpeng Zhai +6Reinforcement LearningRL Fine-Tuning

  2. Extending Differential Temporal Difference Methods for Episodic Problems

    May 6, 2026Kris De Asis, Mohamed Elsayed, Jiamin HeReinforcement LearningTemporal-Difference Learning

  3. Hierarchical Support Vector State Partitioning for Distilling Black Box Reinforcement Learning Policies

    May 5, 2026Senne Deproost, Mehrdad Asadi, Ann NowéReinforcement LearningInterpretability in RL

  4. Optimal Posterior Sampling for Policy Identification in Tabular Markov Decision Processes

    May 5, 2026Cyrille Kone, Kevin JamiesonThompson SamplingMarkov Decision Processes

  5. Enhancing RL Generalizability in Robotics through SHAP Analysis of Algorithms and Hyperparameters

    May 4, 2026Lingxiao Kong, Cong Yang, Oya Deniz Beyan +1RL for RoboticsReinforcement Learning

  6. Recurrent Deep Reinforcement Learning for Chemotherapy Control under Partial Observability

    May 4, 2026Firas Mohamed Elamine Kiram, Imane Youkana, Rachida Saouli +2Reinforcement LearningHealthcare

  7. T2^2PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning

    May 4, 2026Haixin Wang, Hejie Cui, Chenwei Zhang +7Agentic RLReinforcement Learning

  8. Combining Trained Models in Reinforcement Learning

    May 4, 2026Ujjwal Patil, Javad GhofraniReinforcement LearningKnowledge Distillation

  9. Bridging the Gap Between Average and Discounted TD Learning

    May 3, 2026Haoxing Tian, Zaiwei Chen, Ioannis Ch. Paschalidis +1Reinforcement LearningAverage-Reward RL

  10. Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning

    May 3, 2026Arash Ahmadi, Sarah Sharif, Yaser +1Reinforcement LearningLarge Language Model-Guided Optimization

  11. AdamO: A Collapse-Suppressed Optimizer for Offline RL

    May 3, 2026Nan Qiao, Sheng Yue, Shuning Wang +1Reinforcement LearningTemporal-Difference Learning

  12. Quality-Aware Exploration Budget Allocation for Cooperative Multi-Agent Reinforcement Learning

    May 3, 2026Dahyun Oh, Minhyuk Yoon, H. Jin KimMulti-Agent CoordinationIntrinsic Reward Methods

  13. Remote Action Generation: Remote Control with Minimal Communication

    May 3, 2026Szymon Kobus, Deniz GündüzRL ControlReinforcement Learning

  14. Selector-Guided Autonomous Curriculum for One-Shot Reinforcement Learning from Verifiable Rewards

    May 3, 2026Rudray Dave, Vedang Dubey, Smit Deoghare +1Reinforcement LearningRL for Language Model Reasoning

  15. MAGIC: Multi-Step Advantage-Gated Causal Influence for Multi-agent Reinforcement Learning

    May 3, 2026Haohan Yu, Jinmiao Cong, Shengzhi Wang +2Multi-Agent CoordinationIntrinsic Reward Methods

  16. Adversarial Imitation Learning with General Function Approximation: Theoretical Analysis and Practical Algorithms

    May 3, 2026Tian Xu, Zhilong Zhang, Zexuan Chen +3Reinforcement LearningAdversarial Imitation Learning

  17. TRIMMER: A New Paradigm for Video Summarization through Self-Supervised Reinforcement Learning

    May 3, 2026Pritam Mishra, Coloma Ballester, Dimosthenis KaratzasReinforcement LearningVideo Summarization

  18. MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models

    May 2, 2026Yin Zhang, Jiaxuan Zhao, Zonghan Wu +5Vision-Language ModelsReinforcement Learning

  19. PACE: Parameter Change for Unsupervised Environment Design

    May 2, 2026Fang Yuan, Quanjun Yin, Siqi Shen +5Reinforcement Learning

  20. Breaking the Computational Barrier: Provably Efficient Actor-Critic for Low-Rank MDPs

    May 2, 2026Ruiquan Huang, Donghao Li, Yingbin Liang +1Markov Decision ProcessesReinforcement Learning

  21. Faithful Mobile GUI Agents with Guided Advantage Estimator

    May 2, 2026Haowen Hu, Pengzhou Cheng, Zheng Wu +3Reinforcement LearningRL for GUI Agents

  22. Forager: a lightweight testbed for continual learning with partial observability in RL

    May 1, 2026Steven Tang, Xinze Xiong, Anna Hakhverdyan +7RL BenchmarksLoss of Plasticity

  23. Reinforcement Learning with Markov Risk Measures and Multipattern Risk Approximation

    May 1, 2026Andrzej Ruszczynski, Tiangang ZhangMarkov Decision ProcessesReinforcement Learning

  24. Recovering Hidden Reward in Diffusion-Based Policies

    May 1, 2026Yanbiao Ji, Qiuchang Li, Yuting Hu +7Reinforcement LearningDiffusion Policy