Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning

    Jul 29, 2026Jianze Wang, Kunwang Zheng, Ying Liu +5Reinforcement LearningTest-Time RL

  2. RLPF: Reinforcement Learning from Performance Feedback for Code Generation

    Jul 29, 2026Huihao Jing, Haozhe Cui, Wenbin Hu +9RL for Code GenerationReinforcement Learning

  3. Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning

    Jul 29, 2026Gong Gao, Xiao Lai, Ziqi Xie +3Reinforcement LearningActor-Critic Methods

  4. Reinforcement Learning on Cost-Constrained Quadrupedal Hardware

    Jul 29, 2026Javier C. Weddington, Bence P. Ölveczky, Stephen A. BaccusDynamical SystemsReinforcement Learning

  5. Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning

    Jul 29, 2026Keegan Harris, Brian W. Lee, Ian Waudby-Smith +3Reinforcement LearningKL-Regularized RL

  6. Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR

    Jul 28, 2026Pixel Nomand, Elena Voss, Marcus Hale +1Reinforcement LearningRL for Language Model Reasoning

  7. Reinformed Dreamer: An Asymmetric World Model Efficiently Trained through Latent Guidance

    Jul 28, 2026Gaspard Lambrechts, Adrien Bolland, Daniel Ebi +1Reinforcement LearningWorld Models

  8. Reinforcement Learning for Code Optimization

    Jul 28, 2026Pierre Chambon, Kunhao Zheng, Juliette Decugis +2RL for Code GenerationReinforcement Learning

  9. CAST: Game Solvers as Turn-Level Teachers for LLM Agents

    Jul 28, 2026Yu Wang, Yi-Kai Zhang, Wentao Shi +8Reinforcement LearningGame-Playing Agents

  10. A Unified Algorithmic Framework for Hybrid Reinforcement Learning in Tabular MDPs with Shifted Transition Dynamics

    Jul 28, 2026Zheshun Wu, Renjie Zheng, Jinhang Zuo +2Non-Stationary RLRegret Minimization in RL

  11. Inverse RL Helps Align AI by Imitating Humans

    Jul 27, 2026Michał Wiliński, Liu Leqi, Chirag NagpalRL for Language ModelsLLM Alignment

  12. EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff

    Jul 27, 2026Xiao Ma, Zhiquan Hu, Yi Wei +5Reinforcement LearningAgentic RAG

  13. Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning

    Jul 26, 2026Zahra Abdalla Elashaal, Afef Hfaiedh, Nahla Khraief +2Reinforcement LearningHierarchical RL

  14. Offline-Online Curriculum RL for Multimodal Reasoning

    Jul 26, 2026Wendi Deng, Hang Du, Guoshun Nan +11Reinforcement LearningRL for Language Model Reasoning

  15. LA-RL: Label-Aware Self-Reflection for Reinforcement Learning in Information Extraction

    Jul 26, 2026Xiao You, Tianwei Yan, Zixu Shan +2LLM Self-CorrectionRL for Language Models

  16. Label-free Industrial Fault Detection via Adversarial Inverse Reinforcement Learning: A System for Run-to-Failure Prognostics

    Jul 25, 2026Dhiraj Neupane, Mohamed Reda Bouadjenek, Richard Dazeley +1Reinforcement LearningIndustrial Anomaly Detection

  17. Explainable Reinforcement Learning for assisting Air Traffic Controllers

    Jul 24, 2026Anduel Mehmeti, Gabriella Gigante, Salvatore VenticinqueReinforcement LearningIntelligent Transportation Systems

  18. On the Runtime Analysis of Reinforcement Learning Hyper-Heuristics

    Jul 24, 2026Pietro S. Oliveto, Zhenyu Wang, Peizhou Wu +1Reinforcement LearningAutomated Heuristic Design

  19. Variance-Reduced Q-Learning over Static and Time-Varying Networks

    Jul 24, 2026Sreejeet Maity, Feng Zhu, Aritra Mitra +1Reinforcement LearningQ-Learning

  20. Expert Behavior Prior Reinforcement Learning

    Jul 23, 2026Gong Gao, Weidong Zhao, Xianhui Liu +1RL ControlReinforcement Learning

  21. Active Inference as a Convex Markov Decision Process

    Jul 22, 2026Nikola Milosevic, Nicolás Hinrichs, Nico ScherfMarkov Decision ProcessesReinforcement Learning

  22. Drift-Aware RL-based Wavelet Denoising for Network-Traffic Anomaly Detection

    Jul 22, 2026Priyalakshmi Sheela, Indrakshi DeyReinforcement LearningConcept Drift

  23. Generalized Kalman filter based temporal difference reinforcement learning

    Jul 22, 2026Vasos Arnaoutis, Eric Lutters, Bojana RosićRL ControlReinforcement Learning

  24. Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence

    Jul 22, 2026Runlong Zhou, Zihan Zhang, Maryam Fazel +1Regret Minimization in RLMarkov Decision Processes