Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,147

All topics
CardsList
  1. Learning Not to Optimize: Physics-Informed Action-Space Reshaping for Intent-Based Network Control

    Aug 2, 2026Zuyuan Zhang, Vaneet Aggarwal, Tian LanReinforcement LearningPolicy Optimization

  2. SERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic Learning

    Aug 1, 2026Tao Liu, Tao Feng, Xiangheng Li +9Reinforcement LearningText-to-SQL

  3. Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning

    Jul 31, 2026Xujun Che, Yuchen Yuan, Weida Zhao +1Reinforcement LearningKL-Regularized RL

  4. LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback

    Jul 31, 2026Manith Adikari, Bei Peng, Samuele Vinanzi +1Multi-Objective Reinforcement LearningReinforcement Learning

  5. Explore Beyond the Boundary Using Entropic Information

    Jul 31, 2026Bumgeun Park, Donghwan LeeReinforcement LearningRL Exploration

  6. Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity

    Jul 30, 2026Naman Saxena, Mudit Gaur, Vaneet AggarwalReinforcement LearningBilevel Optimization

  7. TAPO: Transition-Aware Policy Optimization for LLM Agents

    Jul 30, 2026Cong Li, Peixi Peng, Yisen Zhao +4Reinforcement LearningRL Post-Training

  8. SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning

    Jul 29, 2026Jianze Wang, Kunwang Zheng, Ying Liu +5Reinforcement LearningTest-Time RL

  9. RLPF: Reinforcement Learning from Performance Feedback for Code Generation

    Jul 29, 2026Huihao Jing, Haozhe Cui, Wenbin Hu +9RL for Code GenerationReinforcement Learning

  10. Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning

    Jul 29, 2026Gong Gao, Xiao Lai, Ziqi Xie +3Reinforcement LearningActor-Critic Methods

  11. Reinforcement Learning on Cost-Constrained Quadrupedal Hardware

    Jul 29, 2026Javier C. Weddington, Bence P. Ölveczky, Stephen A. BaccusDynamical SystemsReinforcement Learning

  12. Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning

    Jul 29, 2026Keegan Harris, Brian W. Lee, Ian Waudby-Smith +3Reinforcement LearningKL-Regularized RL

  13. Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR

    Jul 28, 2026Pixel Nomand, Elena Voss, Marcus Hale +1Reinforcement LearningRL for Language Model Reasoning

  14. Reinformed Dreamer: An Asymmetric World Model Efficiently Trained through Latent Guidance

    Jul 28, 2026Gaspard Lambrechts, Adrien Bolland, Daniel Ebi +1Reinforcement LearningWorld Models

  15. Reinforcement Learning for Code Optimization

    Jul 28, 2026Pierre Chambon, Kunhao Zheng, Juliette Decugis +2RL for Code GenerationReinforcement Learning

  16. CAST: Game Solvers as Turn-Level Teachers for LLM Agents

    Jul 28, 2026Yu Wang, Yi-Kai Zhang, Wentao Shi +8Reinforcement LearningGame-Playing Agents

  17. A Unified Algorithmic Framework for Hybrid Reinforcement Learning in Tabular MDPs with Shifted Transition Dynamics

    Jul 28, 2026Zheshun Wu, Renjie Zheng, Jinhang Zuo +2Non-Stationary RLRegret Minimization in RL

  18. Inverse RL Helps Align AI by Imitating Humans

    Jul 27, 2026Michał Wiliński, Liu Leqi, Chirag NagpalRL for Language ModelsLLM Alignment

  19. EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff

    Jul 27, 2026Xiao Ma, Zhiquan Hu, Yi Wei +5Reinforcement LearningAgentic RAG

  20. Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning

    Jul 26, 2026Zahra Abdalla Elashaal, Afef Hfaiedh, Nahla Khraief +2Reinforcement LearningHierarchical RL

  21. Offline-Online Curriculum RL for Multimodal Reasoning

    Jul 26, 2026Wendi Deng, Hang Du, Guoshun Nan +11Reinforcement LearningRL for Language Model Reasoning

  22. LA-RL: Label-Aware Self-Reflection for Reinforcement Learning in Information Extraction

    Jul 26, 2026Xiao You, Tianwei Yan, Zixu Shan +2LLM Self-CorrectionRL for Language Models

  23. Label-free Industrial Fault Detection via Adversarial Inverse Reinforcement Learning: A System for Run-to-Failure Prognostics

    Jul 25, 2026Dhiraj Neupane, Mohamed Reda Bouadjenek, Richard Dazeley +1Reinforcement LearningIndustrial Anomaly Detection

  24. Explainable Reinforcement Learning for assisting Air Traffic Controllers

    Jul 24, 2026Anduel Mehmeti, Gabriella Gigante, Salvatore VenticinqueReinforcement LearningIntelligent Transportation Systems

  25. On the Runtime Analysis of Reinforcement Learning Hyper-Heuristics

    Jul 24, 2026Pietro S. Oliveto, Zhenyu Wang, Peizhou Wu +1Reinforcement LearningAutomated Heuristic Design