Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. LEPO: Latent Reasoning Policy Optimization for Large Language Models

    Apr 20, 2026Yuyan Zhou, Jiarui Yu, Hande Dong +4Reinforcement LearningRL for Language Model Reasoning

  2. Poly-EPO: Training Exploratory Reasoning Models

    Apr 19, 2026Ifdita Hasan Orney, Jubayer Ibn Hamid, Shreya S Ramanujam +5Reinforcement LearningRL for Language Model Reasoning

  3. CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search

    Apr 19, 2026Hansi Zeng, Liam Collins, Bhuvesh Kumar +2Reinforcement LearningLearning to Rank

  4. SVL: Goal-Conditioned Reinforcement Learning as Survival Learning

    Apr 19, 2026Franki Nguimatsia Tiofack, Fabian Schramm, Théotime Le Hellard +1Reinforcement LearningGoal-Conditioned RL

  5. Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception

    Apr 19, 2026Ashutosh Bajpai, Tamal Majumder, Akshay Nambi +1Reinforcement LearningTool-Using Vision-Language Agents

  6. Beyond the Bellman Fixed Point: Geometry and Fast Policy Identification in Value Iteration

    Apr 19, 2026Donghwan LeeMarkov Decision ProcessesReinforcement Learning

  7. Live LTL Progress Tracking: Towards Task-Based Exploration

    Apr 18, 2026Noel Brindise, Cedric Langbort, Melkior OrnikReinforcement LearningLinear Temporal Logic

  8. SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models

    Apr 18, 2026Yifu Huo, Chenglong Wang, Ziming Zhu +9Reinforcement LearningRL for Language Model Reasoning

  9. NaviFormer: A Deep Reinforcement Learning Transformer-like Model to Holistically Solve the Navigation Problem

    Apr 18, 2026Daniel Fuertes, Andrea Cavallaro, Carlos R. del-Blanco +2Reinforcement LearningRobot Navigation

  10. Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning

    Apr 18, 2026Weiyu Ma, Yongcheng Zeng, Yan Song +4Reinforcement LearningRL Post-Training

  11. EasyVideoR1: Easier RL for Video Understanding

    Apr 18, 2026Chuanyu Qin, Chenxu Yang, Qingyi Si +6Reinforcement LearningVideo-Language Models

  12. GRAIL: Autonomous Concept Grounding for Neuro-Symbolic Reinforcement Learning

    Apr 18, 2026Hikaru Shindo, Henri Rößler, Quentin Delfosse +1Reinforcement LearningLLM-Guided RL

  13. Beyond Distribution Sharpening: The Importance of Task Rewards

    Apr 17, 2026Sarthak Mittal, Leo Gagnon, Guillaume LajoieReinforcement LearningRL for Language Model Reasoning

  14. Multi-objective Reinforcement Learning With Augmented States Requires Rewards After Deployment

    Apr 17, 2026Peter Vamplew, Cameron FoaleMulti-Objective Reinforcement LearningReinforcement Learning

  15. Flexible Empowerment at Reasoning with Extended Best-of-N Sampling

    Apr 17, 2026Taisuke KobayashiReinforcement LearningBest-of-N Sampling

  16. CSLE: A Reinforcement Learning Platform for Autonomous Security Management

    Apr 16, 2026Kim HammarReinforcement LearningAutonomous Cyber Defense

  17. Beyond Single-Model Optimization: Preserving Plasticity in Continual Reinforcement Learning

    Apr 16, 2026Lute Lillo, Nick CheneyNon-Stationary RLReinforcement Learning

  18. LongAct: Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning

    Apr 16, 2026Bowen Ping, Zijun Chen, Tingfeng Hui +4Reinforcement LearningRL for Language Model Reasoning

  19. Targeted Exploration via Unified Entropy Control for Reinforcement Learning

    Apr 16, 2026Chen Wang, Lai Wei, Yanzhi Zhang +5Reinforcement LearningRL for Language Model Reasoning

  20. Deep Learning for Sequential Decision Making under Uncertainty: Foundations, Frameworks, and Frontiers

    Apr 13, 2026I. Esra BuyuktahtakinReinforcement LearningPredict-Then-Optimize

  21. Less Data Approximates More: Earning Faithful Confidence in High-Stakes Domains

    Apr 9, 2026Haokai Ma, Lee Yan Zhen, Gang Yang +4RL for Language ModelsReinforcement Learning

  22. Incremental Residual Reinforcement Learning Toward Real-World Learning for Social Navigation

    Apr 9, 2026Haruto Nagahisa, Kohei Matsumoto, Yuki Tomita +2Reinforcement LearningMobile Robotics

  23. ReBound: Reset-Free Reinforcement Learning for Agile Driving via Reset-Aware Semi-Markov Bootstrapping

    Apr 9, 2026Kohei Honda, Aiki Kada, Hirotaka HosogayaReinforcement LearningRL for Autonomous Driving

  24. An Imperfect Verifier is Good Enough: Learning with Noisy Rewards

    Apr 9, 2026Andreas Plesner, Francisco Guzmán, Anish AthalyeRL for Code GenerationReinforcement Learning

  25. Value Mirror Descent for Reinforcement Learning

    Apr 7, 2026Zhichao Jia, Guanghui LanMarkov Decision ProcessesReinforcement Learning

  26. Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning

    Apr 2, 2026Yuhang Wu, Xiangqing Shen, Fanfan Wang +4Retrieval-Augmented GenerationReinforcement Learning

  27. Planning for Change: Reinforcement Learning Combined with Bounded Extremum Seeking for Robotic Control under Distribution Shift

    Apr 1, 2026Shaifalee Saxena, Rafael Fierro, Alexander ScheinkerRobotic ControlReinforcement Learning