Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. StepGuard: Guarding Web Navigation via Single-Step Calibration

    Jun 16, 2026Zhihao Cui, Yuchen Zhang, Xiyang Sun +6Agentic RLReinforcement Learning

  2. From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning

    Jun 16, 2026Chao Chen, Chengzu Li, Zhiwei Li +2Reinforcement LearningLLM-Guided RL

  3. TRIDENT: Breaking the Hybrid-Safety-Physics Coupling for Provably Safe Multi-Agent Reinforcement Learning

    Jun 16, 2026Zijie Meng, Ziwei Li, Yufei Liu +5Cyber-Physical SystemsReinforcement Learning

  4. Closing the Feedback Loop: From Experience Extraction to Insight Governance in Verbal Reinforcement Learning

    Jun 16, 2026Yanwei Cui, Xing Zhang, Yulong Zhang +4Continual Learning for LLM AgentsNon-Stationary RL

  5. Reversal Q-Learning

    Jun 16, 2026Aditya Oberai, Seohong Park, Sergey LevineReinforcement LearningQ-Learning

  6. Multi-Adapter PPO: A Cross-Attention Enhanced Wavelength Selection Framework for LIBS Quantitative Analysis

    Jun 16, 2026Hao Li, Man Fung ZhuoReinforcement LearningProximal Policy Optimization

  7. Performance-Driven Environment Abstraction with Multi-Timescale Learning

    Jun 16, 2026Yue Guan, Dipankar Maity, Panagiotis TsiotrasMarkov Decision ProcessesReinforcement Learning

  8. Decision-Driven Geosteering Under Uncertainty: A Unified Framework for Sequential Decision Optimization

    Jun 15, 2026Hibat Errahmen Djecta, Sergey Alyaev, Kristian Fossum +3RL ControlReinforcement Learning

  9. Rethinking Groups in Critic-Free RLVR

    Jun 15, 2026Yihong Wu, Liheng Ma, Lingfeng Xiao +4Reinforcement LearningRL for Language Model Reasoning

  10. ExpRL: Exploratory RL for LLM Mid-Training

    Jun 15, 2026Violet Xiang, Amrith Setlur, Chase Blagden +2Reinforcement LearningRL for Language Model Reasoning

  11. Understanding the Behaviors of Environment-aware Information Retrieval

    Jun 15, 2026Ruifeng Yuan, Chaohao Yuan, David Dai +4Retrieval-Augmented GenerationReinforcement Learning

  12. Maximum Entropy Inverse Reinforcement Learning for Mean-Field Games with Average Reward

    Jun 15, 2026Şevket Kaan Alkır, Naci Saldı, Berkay Anahtarcı +1Reinforcement LearningAverage-Reward RL

  13. Learning Policy from a Single Trajectory in Average-Reward Markov Decision Process

    Jun 15, 2026Jongmin Lee, Ernest K. Ryu, Vaneet AggarwalMarkov Decision ProcessesReinforcement Learning

  14. DifferAD-R1: A Difference-Guided IndustrialAnomaly Localization with Multimodal LargeLanguage Models

    Jun 15, 2026Dingrong Wang, Xian Tao, Zhen Qu +5Reinforcement LearningIndustrial Anomaly Detection

  15. Infant Spontaneous Movement Noise Improves Exploration in Deep RL

    Jun 15, 2026Francisco M. López, Markus R. Ernst, Francisco Cruz +2Reinforcement LearningRL Exploration

  16. Incentives and Evidence in Learned Service Orchestration

    Jun 15, 2026Syed Izhan Khilji, Alireza Furutanpey, Schahram DustdarRL ControlReinforcement Learning

  17. RL-Index: Reinforcement Learning for Retrieval Index Reasoning

    Jun 15, 2026Yongjia Lei, Nedim Lipka, Zhisheng Qi +5Reinforcement LearningAgentic Retrieval

  18. Evolutionary Bilevel Reward Shaping for Generalization in Reinforcement Learning

    Jun 15, 2026Ekasit Usaratniwart, Xilin Gao, Marc Ong +1Reinforcement LearningReward Shaping

  19. FlashNav: Training Deployable Robot Navigation Policies in Seconds

    Jun 14, 2026Shanze Wang, Yiwei Qian, Xinming Zhang +8Robot Policy LearningReinforcement Learning

  20. Understanding Diversity Collapse in RLVR via the Lens of Overtraining

    Jun 13, 2026Suqin Yuan, Jinkun Chen, Jiyang Zheng +6Reinforcement LearningReasoning Diversity

  21. Discovering Lattice Reduction Strategies via Self-Play

    Jun 13, 2026Mohamed Malhou, Kristin Lauter, Ludovic PerretReinforcement LearningRL for Combinatorial Optimization

  22. Exploring Starts Are Not Enough: Counterexamples and a Fix for Monte Carlo Exploring Starts

    Jun 13, 2026Octave Oliviers, Glenn VinnicombeRL ControlReinforcement Learning

  23. StarOR: Synergizing Tree Search and Test-Time Reinforcement Learning for Optimization Modeling

    Jun 13, 2026Jiajun Li, Yu Ding, Shisi Guan +2Reinforcement LearningLarge Language Model-Guided Optimization

  24. Safe Reinforcement Learning of Autonomous Highway Driving: A Unified Framework for Safety and Efficiency

    Jun 12, 2026Chufei Yan, Zhihao Cui, Yiyan Lv +3Reinforcement LearningMixture of Experts

  25. Lyapunov-Based Sample Complexity Analysis for Weakly-Coupled MDPs

    Jun 12, 2026Tianhao Wu, Matthew Zurek, Weina Wang +1Multi-Armed BanditsRobust Markov Decision Processes

  26. Explainable and Trustworthy Speech Emotion Recognition Using Confidence Score and Reinforcement Learning Rectified Speech Emotion Descriptors

    Jun 12, 2026Youjun Chen, Xurong Xie, Mengzhe Geng +9Explainable Artificial IntelligenceReinforcement Learning