Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Beyond One-Size-Fits-All: Diagnosis-Driven Online Reinforcement Learning with Offline Priors

    Jun 24, 2026Guozheng Ma, Lu Li, Zilin Wang +2Reinforcement LearningRL Post-Training

  2. The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms

    Jun 24, 2026Jinghan Zhang, Zerui Cheng, Shiqi Chen +5Neural Network GeneralizationReinforcement Learning

  3. FactorLibrary: From Polynomials to Circuits via Recursive Subgoals

    Jun 24, 2026Rohan Pandey, Michael Ruofan Zeng, Weikun K. Zhang +5Circuit DiscoveryReinforcement Learning

  4. Compositional Behavioral Semantics for State Abstraction in Reinforcement Learning

    Jun 24, 2026Yivan Zhang, Ziyan Luo, Manuel BaltieriReinforcement LearningState Abstraction

  5. Minimax PAC Bounds for Learning in Exogenous Contextual MDPs

    Jun 23, 2026Corentin Pla, Hugo Richard, Marc Abeille +1Markov Decision ProcessesReinforcement Learning

  6. Bias-Controlled Primal-Dual Natural Actor-Critic: Optimal Rates for Constrained Multi-Objective Average-Reward RL

    Jun 23, 2026Ankur Naskar, Swetha Ganesh, Vaneet AggarwalMulti-Objective Reinforcement LearningReinforcement Learning

  7. Accelerating Disaggregated RL for Visual Generative LLMs with Diffusion-Based Parallelism and Trainer-Assisted Generation

    Jun 23, 2026Sijie Wang, Zhengyu Qing, Zhiqiang Tan +6Reinforcement LearningDistributed RL

  8. Supervised Reinforcement Learning for the Coordination of Distributed Energy Resources

    Jun 23, 2026Haoyuan Deng, Yihong Zhou, Thomas Morstyn +1Reinforcement LearningRL Fine-Tuning

  9. An Introduction to Causal Reinforcement Learning

    Jun 23, 2026Elias Bareinboim, Junzhe Zhang, Sanghack LeeReinforcement LearningCausal Inference

  10. SPIRAL: Learning to Search and Aggregate

    Jun 22, 2026Jubayer Ibn Hamid, Ifdita Hasan Orney, Michael Y. Li +5Reinforcement LearningRL for Language Model Reasoning

  11. Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning

    Jun 22, 2026Yunan Wang, Minghui Song, Zihan Zhang +6Agentic RLReinforcement Learning

  12. Evo-RAD: Navigating Rare Retinal Disease Diagnosis via Self-Evolving Agentic Retrieval

    Jun 22, 2026Wangding Xia, Ye Du, Jiashi Lin +3Reinforcement LearningRare Disease Diagnosis

  13. What are Key Factors for Updates in RL for LLM Reasoning?

    Jun 21, 2026Peidong Wang, Demi Wang, Xufang Luo +5Reinforcement LearningRL for Language Model Reasoning

  14. Select-to-Act: Hierarchical Reinforcement Learning via Adaptive Language Guidance

    Jun 21, 2026Hanping Zhang, Adam Koziak, Yuhong GuoReinforcement LearningHierarchical RL

  15. Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning

    Jun 21, 2026Zicheng Xu, Ruixuan Zhang, Yu-Neng Chuang +7Reinforcement LearningRL for Language Model Reasoning

  16. Drowning in Routine: Signal Dilution in Multi-Turn Agent Training

    Jun 20, 2026Yann Pernot, Vi RetaultReinforcement LearningCredit Assignment in RL

  17. Deep RL for Fast Long-Horizon Operations Scheduling on NASA's Carruthers Geocorona Observatory Mission

    Jun 20, 2026Alex Zhang, Jackson Craig, Lara WaldropReinforcement LearningLong-Horizon Planning

  18. Reinforcement Learning-Based Traffic Signal Control for IoT-Enabled Intersections

    Jun 20, 2026Yousef AlSaqabiReinforcement LearningIntelligent Transportation Systems

  19. IRumAI: Reinforcement Learning for Indian Rummy

    Jun 20, 2026Vignesh MohanReinforcement LearningGame-Playing Agents

  20. Discretizing Reward Models

    Jun 19, 2026Vijay Viswanathan, Shiqi Wang, Devamanyu Hazarika +4Reward ModelingReinforcement Learning

  21. The Two-Hump Problem: Bridging the Difficulty Gap in Mathematical Reinforcement Learning

    Jun 19, 2026Lucas Fagan, Michele Tarquini, Ali Shehper +6RL BenchmarksReinforcement Learning

  22. FAST: A Framework for Aligned Sampling and Training in Parallel Reinforcement Learning for Autonomous Driving

    Jun 19, 2026Bonan Wang, Letian Tao, Bin Shuai +7Reinforcement LearningRL for Autonomous Driving

  23. A Reward-Petri-Net Interpretation of Temporal Behavior Trees

    Jun 19, 2026Till Schmeil, Günther Waxenegger-Wilfing, Sebastian SchirmerReinforcement LearningReward Shaping

  24. Objective-Behavior Alignment: Diagnostics for MORL Policy Selection

    Jun 19, 2026Antonio Mone, Zuzanna Osika, Florian Felten +4Multi-Objective Reinforcement LearningReinforcement Learning

  25. NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning

    Jun 19, 2026Xinwei Liu, Junyuan Liang, Zicong Hong +2Reinforcement LearningQ-Learning

  26. Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization

    Jun 19, 2026Marco Pratticò, Pietro Novelli, Massimiliano Pontil +1Reinforcement LearningExploration-Exploitation Tradeoff

  27. Inverting the Bellman Equation: From QQ-Values to World Models

    Jun 19, 2026Alistair Letcher, Mattie Fellows, Alexander D. Goldie +3Reinforcement LearningModel-Free RL

  28. ReFPO: Reflow Regularization for Flow Matching Policy Gradients

    Jun 19, 2026Ge Wang, Yibo Peng, Fan Feng +10Policy GradientReinforcement Learning