Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Trading Confidence: Comprehensive Uncertainty Estimation in Algorithmic Trading

    Jul 3, 2026Lin Li, Li Rong Wang, Hsuan Fu +1Reinforcement LearningUncertainty Quantification

  2. Generalization in offline RL: The structure is more important than the amount of pessimism

    Jul 2, 2026Max Weltevrede, Matthijs T. J. Spaan, Wendelin BöhmerReinforcement LearningOffline RL

  3. Cross-Platform Control for Autonomous Surface Vehicles via Adaptive Reinforcement Learning

    Jul 2, 2026Ruiheng Jiang, Thomas Bi, Raffaello D'Andrea +1Robotic ControlRobot Trajectory Tracking

  4. Full Bayesian Reinforcement Learning via LF-IBIS

    Jul 2, 2026Stefano Masini, Cecilia Viscardi, Michela BacciniSimulation-Based InferenceReinforcement Learning

  5. One Demonstration Is Enough for Real-World Robotic Reinforcement Learning

    Jul 2, 2026Yuwan Liu, Hongze Yu, Song Liu +5Reinforcement LearningRobot Skill Learning

  6. Mean Field Reinforcement Learning

    Jul 1, 2026René Carmona, Mathieu LaurièreReinforcement LearningQ-Learning

  7. The Rollout Infrastructure Tax in Coding-Agent Reinforcement Learning

    Jul 1, 2026Daniel Thi Graviet, Lovre Pesut, Ivan Dagelic +2RL for Code GenerationSoftware Engineering Agents

  8. Scaling Laws for Collapse in Asynchronous GRPO

    Jul 1, 2026Jingwei Song, Haofeng Xu, Jie Xiao +7Asynchronous RLReinforcement Learning

  9. From Pixels to Temporal Correlations: Learning Informative Representations for Reinforcement Learning Pre-training

    Jul 1, 2026Jinwen Wang, Youfang Lin, Xiaobo Hu +4Contrastive LearningReinforcement Learning

  10. Coachable agents for interactive gameplay

    Jul 1, 2026Roberto Capobianco, Harm van Seijen, Nolan D. Bard +38Reinforcement Learning

  11. Learning Gait-Aware Quadruped Locomotion with Temporal Logic Specifications

    Jul 1, 2026Merve Atasever, Cagan Bakirci, Alfredo Reina Corona +2Reinforcement LearningRobot Skill Learning

  12. Learning Generalizable Skill Policy with Data-Efficient Unsupervised RL

    Jul 1, 2026Jongchan Park, Seungjun Oh, Seungho Baek +1Reinforcement LearningRobot Policy Generalization

  13. SLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory Slicing

    Jun 30, 2026Ruikang Zhao, Zhenting Wang, Han Gao +1Reinforcement LearningRL for Language Model Reasoning

  14. Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs

    Jun 30, 2026Gabrielle Kaili-May Liu, Avi Caciularu, Gal Yona +2RL for Language ModelsReinforcement Learning

  15. Adapting Generalist Robot Policies with Semantic Reinforcement Learning

    Jun 30, 2026Jagdeep Singh Bhatia, Andrew Wagenmaker, William Chen +1Robot Policy LearningRobot Policy Adaptation

  16. Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions

    Jun 30, 2026Mingyi Li, Taira Tsuchiya, Kenji YamanishiRegret Minimization in RLMarkov Decision Processes

  17. UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

    Jun 30, 2026Yaozhi Zheng, Yilei Jiang, Manyuan Zhang +5RL for Code GenerationReinforcement Learning

  18. FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion

    Jun 30, 2026Guanchen Lu, Yajuan Dun, Yi Zhou +4Distributional RLReinforcement Learning

  19. Which Tokens Matter? Adaptive Token Selection for RLVR with the Relative Surprisal Index

    Jun 30, 2026Outongyi Lv, Yanzhao Zheng, Yuanwei Zhang +5Reinforcement LearningRL for Language Model Reasoning

  20. ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents

    Jun 30, 2026Binjie Zhang, Mike Zheng ShouReinforcement LearningGroup Relative Policy Optimization

  21. Revealing Safety-Critical Scenarios for UTM via Transformer

    Jun 30, 2026Huaze Tang, Bill Zeng, Chao Wang +3Reinforcement LearningIntelligent Transportation Systems

  22. Offline Reinforcement Learning for Fluid Controls: Data-based Multi-observational Policy Extraction

    Jun 30, 2026Deepak Akhare, Luning Sun, Xin-Yang Liu +4RL ControlReinforcement Learning

  23. HyPOLE: Hyperproperty-Guided Multi-Agent Reinforcement Learning under Partial Observation

    Jun 29, 2026Arshia Rafieioskouei, Tzu-Han Hsu, Matthew Lucas +1Reinforcement LearningPartially Observable RL

  24. Learning Where to Look: A Reinforcement Learning Framework for Robust Micro-Ultrasound Prostate Cancer Detection

    Jun 29, 2026Mohammad Mahdi Abootorabi, Sina Namazi, Armin Saadat +7Medical ImagingReinforcement Learning

  25. Experience Augmented Policy Optimization for LLM Reasoning

    Jun 29, 2026Jinda Lu, Kexin Huang, Junkang Wu +7Reinforcement LearningRL for Language Model Reasoning

  26. Exploration and Online Transfer with Behavioral Foundation Models

    Jun 29, 2026Louis Bagot, Mathieu Lefort, Laëtitia MatignonReinforcement LearningRL Exploration