Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Beyond Pixels: Learning Invariant Rewards for Real-World Robotics From a Few Demonstrations

    May 21, 2026Tengye Xu, Yangting Sun, Ziju Shen +5Reinforcement LearningGeneralization in Robotic Manipulation

  2. On the Sample Complexity of Discounted Reinforcement Learning with Optimized Certainty Equivalents

    May 20, 2026Oliver Mortensen, Mohammad Sadegh TalebiReinforcement LearningRisk-Sensitive RL

  3. Value-Gradient Hypothesis of RL for LLMs

    May 20, 2026Arip Asadulaev, Daniil Ognev, Karim Salta +1RL for Language ModelsPolicy Gradient

  4. Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent

    May 20, 2026Zeyuan Wang, Da Li, Yulin Chen +6Reinforcement LearningMaximum Entropy RL

  5. Behavior-Consistent Deep Reinforcement Learning

    May 20, 2026Marcel Hussing, Liv G. d'Aliberti, Claas Voelcker +2Reinforcement LearningPolicy Optimization

  6. Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards

    May 20, 2026Erfan Aghadavoodi Jolfaei, Daniel Maninger, Abhinav Anand +2RL for Code GenerationReinforcement Learning

  7. Beyond the Bellman Recursion: A Pontryagin-Guided Framework for Non-Exponential Discounting

    May 20, 2026Hojin Ko, Jeonggyu HuhReinforcement LearningStochastic Optimal Control

  8. For How Long Should We Be Punching? Learning Action Duration in Fighting Games

    May 20, 2026Hoang Hai Nguyen, Kurt Driessens, Dennis J. N. J. SoemersReinforcement LearningGame-Playing Agents

  9. Compositional Transduction with Latent Analogies for Offline Goal-Conditioned Reinforcement Learning

    May 20, 2026Junseok Kim, Dohyeong Kim, Mineui Hong +1Reinforcement LearningRobotic RL

  10. ReversedQ: Opportunities for Faster Q-Learning in Episodic Online Reinforcement Learning

    May 20, 2026Sofia R. Miskala-Dinc, Aviva PrinsReinforcement LearningQ-Learning

  11. Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents

    May 19, 2026Wenjie Tang, Minne Li, Sijie Huang +2Reinforcement LearningPartially Observable RL

  12. A conceptual framework for learning to listen by reward: Curiosity-driven search for novel sources

    May 19, 2026Andreas Triantafyllopoulos, Jakub Šťastný, Alexios Terpinas +3Reinforcement LearningIntrinsic Motivation

  13. Beyond Action Residuals: Real-World Robot Policy Steering via Bottleneck Latent Reinforcement Learning

    May 19, 2026Dongjie Yu, Kun Lei, Zhennan Jiang +2Robot Policy AdaptationReinforcement Learning

  14. Minimax Optimal Variance-Aware Regret Bounds for Multinomial Logistic MDPs

    May 19, 2026Pierre Boudart, Pierre Gaillard, Alessandro RudiRegret Minimization in RLMarkov Decision Processes

  15. GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment

    May 19, 2026Minxuan Lv, Tiehua Mei, Tanlong Du +9Reinforcement LearningLong-Context Modeling

  16. What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents

    May 19, 2026Xiaozhe Li, Tianyi Lyu, Yang Li +6Reinforcement LearningCredit Assignment in RL

  17. Precision Physical Activity Prescription via Reinforcement Learning for Functional Actions

    May 19, 2026Gefei Lin, Rui Miao, Jennifer Sacheck +1Reinforcement LearningOffline RL

  18. A Heuristic Approach for Performance Tuning in RL-based Quadrotor Control via Reward Design and Termination Conditions

    May 18, 2026Fausto Mauricio Lagos Suarez, Akshit Saradagi, Vidya Sumathy +1RL ControlRobot Trajectory Tracking

  19. AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning

    May 18, 2026Peilin Wu, Xinlu Zhang, Kun Wan +4RL for Language ModelsReinforcement Learning

  20. DiPRL: Learning Discrete Programmatic Policies via Architecture Entropy Regularization

    May 18, 2026Chengpeng Hu, Yingqian Zhang, Hendrik BaierReinforcement LearningProgram Synthesis

  21. Scheduling That Speaks: An Interpretable Programmatic Reinforcement Learning Framework

    May 18, 2026Chengpeng Hu, Yingqian Zhang, Hendrik BaierReinforcement LearningInterpretable ML

  22. PH-Dreamer: A Physics-Driven World Model via Port-Hamiltonian Generative Dynamics

    May 18, 2026Xueyu Luan, Chenwei ShiDynamical SystemsReinforcement Learning

  23. Privacy Preserving Reinforcement Learning with One-Sided Feedback

    May 18, 2026Lin William Cong, Guangyan Gan, Hanzhang Qin +1Reinforcement LearningPartially Observable RL

  24. RL4RLA: Teaching ML to Discover Randomized Linear Algebra Algorithms Through Curriculum Design and Graph-Based Search

    May 18, 2026Jinglong Xiong, Xiaotian Liu, Ruoxin Wang +4Reinforcement LearningAutomated Algorithm Discovery

  25. Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning

    May 18, 2026Zhanyue Qin, Jia Feng, Yibo Lyu +4Reinforcement LearningRL for Language Model Reasoning

  26. GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

    May 18, 2026Xiongbin Wu, Zhihao Luo, Shanzhe Lei +7Reinforcement LearningGroup Relative Policy Optimization

  27. HydroAgent: Closing the Gap Between Frontier LLMs and Human Experts in Hydrologic Model Calibration via Simulator-Grounded RL

    May 18, 2026Zhi Li, Songkun Yan, Jie Cao +4Reinforcement LearningModel Calibration