Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL

    Jun 1, 2026Zelin He, Haotian Lin, Boran Han +6Reinforcement LearningLLM Agent Skill Learning

  2. TRON: Targeted Rule-Verifiable Online Environments for Visual Reasoning RL

    Jun 1, 2026Tianze Yang, Yucheng Shi, Ruitong Sun +3Reinforcement LearningVLM Reasoning

  3. Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies

    May 31, 2026Hikmet Simsir, Ozgur S. OguzRobot Policy AdaptationReinforcement Learning

  4. Deep Research as Rubric for Reinforcement Learning

    May 31, 2026Wangyi Mei, Zhouhong Gu, Zhenhan Bai +9Open-Ended GenerationReinforcement Learning

  5. Interaction-Limited Safe Continuous-Time RL for Dynamical Medical Treatment

    May 31, 2026Xun Shen, Yuepeng Wang, Akifumi Wachi +13Reinforcement LearningSequential Decision Making

  6. A Unified Benchmark for Dynamic Medical Treatment Reinforcement Learning

    May 31, 2026Yuepeng Wang, Ken Kawano, Yoshihiko Fujisawa +12RL BenchmarksReinforcement Learning

  7. Explainable deep reinforcement learning reveals energy-efficient control strategies for turbulent drag reduction

    May 31, 2026Federica Tonti, Ricardo VinuesaRL ControlReinforcement Learning

  8. Task diversity produces systematic transfer but inhibits continual reinforcement learning

    May 30, 2026Purab Seth, Neil Shah, Ishaan Sinha +4RL BenchmarksReinforcement Learning

  9. Certificate-Guided Evaluation of Reinforcement Learning Generalization

    May 30, 2026Vignesh Subramanian, Đorđe Žikelić, Suguman BansalRL BenchmarksReinforcement Learning

  10. Decoupled Behavioral Cloning for Scalable Inductive Generalization in RL from Specifications

    May 30, 2026Vignesh Subramanian, Subhajit Roy, Suguman BansalReinforcement LearningMeta-Reinforcement Learning

  11. GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval

    May 30, 2026Shihang Zhang, Mingjin Kuai, Ye Wei +2Temporal Video GroundingReinforcement Learning

  12. Regularized Offline Policy Optimization with Posterior Hybrid Bayesian Belief

    May 30, 2026Hongqiang Lin, Pengfei Wang, Nenggan ZhengReinforcement LearningBayesian RL

  13. Cortex and subcortex play distinct roles over learning when cortical memory is limited

    May 30, 2026Matthew Farrell, Taro ToyoizumiComputational Cognitive ModelingReinforcement Learning

  14. CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts

    May 30, 2026Rui Zhang, Xinle Wu, Yao LuReward ModelingReinforcement Learning

  15. Interpretable Policy Distillation for Power Grid Topology Control

    May 30, 2026Aleksandra Dmitruka, Karlis FreivaldsRL ControlReinforcement Learning

  16. Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems

    May 29, 2026Jonathan Colaço Carr, Prakash Panangaden, Doina Precup +1Pairwise Preference LearningMarkov Decision Processes

  17. Drift Q-Learning

    May 29, 2026Anas Houssaini, Mohamad H. Danesh, Amin Abyaneh +3Reinforcement LearningQ-Learning

  18. Physical Atari: A Robust and Accessible Platform for Real-time Reinforcement Learning on Robots

    May 29, 2026Khurram Javed, Joseph Modayil, Gloria Kennickell +2RL BenchmarksReinforcement Learning

  19. The Representation-Rationalizability Tradeoff in Reward Learning

    May 29, 2026Jing Dong, Yaoliang Yu, Pascal PourpartPairwise Preference LearningReward Modeling

  20. Value Functions as Supermartingale Certificates

    May 29, 2026Alessandro Abate, Daniel Contro, Mirco Giacobbe +2Reinforcement LearningFormal Verification

  21. DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization

    May 29, 2026Jian Mu, Tianyi Lin, Chengwei Qin +2Supervised Fine-TuningRL for Language Models

  22. Answer-Set-Programming-based Abstractions for Reinforcement Learning

    May 29, 2026Rafael Bankosegger, Thomas Eiter, Johannes OetschReinforcement LearningState Abstraction

  23. Constrained Multi-Objective Reinforcement Learning with Max-Min Criterion

    May 29, 2026Giseung Park, Hyunyoung Nam, Woohyeon Byeon +2Multi-Objective Reinforcement LearningReinforcement Learning

  24. Survival Reinforcement Learning: Toward Scalable Self-Supervised RL

    May 29, 2026Franki Nguimatsia-Tiofack, Fabian Schramm, Théotime Le Hellard +1Reinforcement LearningGoal-Conditioned RL

  25. EchoRL: Reinforcement Learning via Rollout Echoing

    May 29, 2026Jinhe Bi, Aniri, Minglai Yang +9Reinforcement LearningRL for Language Model Reasoning

  26. Enhancing Human-Likeness in Reinforcement Learning Agents via Hierarchical Macro Action Quantization

    May 29, 2026M. Shaheer Luqman, Usman Nizamani, Fawad Javed Fateh +4Latent Action LearningReinforcement Learning

  27. Inverse Reinforcement Learning without an Optimal Demonstrator: A Feasible Reward Set Approach

    May 29, 2026Kihyun Kim, Shripad Deshmukh, Nikos Vlassis +1Reinforcement LearningLearning from Demonstration

  28. DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning

    May 29, 2026Yujie Wang, Siwei Chen, Longzan Luo +4RL for Language ModelsReinforcement Learning