Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Efficient Real-World Online Reinforcement Learning for Robot Manipulation via Centralized Training and Critic Decomposition

    Aug 10, 2026Changhao Li, Yifang Zhang, Heng Zhang +6Reinforcement LearningRobotic RL

  2. Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training

    Aug 10, 2026Ting Zhou, Zhenqing Ling, Daoyuan Chen +4Reinforcement LearningRL for Language Model Reasoning

  3. VTO: Visual Tool Orchestration for Video Anomaly Detection

    Aug 8, 2026Rui Wang, Yeteng Wu, Xianling Zhang +1Reinforcement LearningVideo Anomaly Detection

  4. V-Simba: Unleashing the Architectural Potential of RL in Visual Continuous Control

    Aug 8, 2026Donghu Kim, Youngdo Lee, Hojoon Lee +6Reinforcement LearningVisual RL

  5. Learning Suffers More Than the Policy Class Under Partial Observability: A Closed-Form Analysis

    Aug 7, 2026Idil GözelRL ControlReinforcement Learning

  6. Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control

    Aug 7, 2026Qi Zhao, Guozheng Ma, Yilun Kong +9Reinforcement LearningExperience Replay

  7. PAST: Prompt-Adaptive Sampling Termination for Efficient Diffusion Model

    Aug 7, 2026Renye Yan, Jikang Cheng, You Wu +4Intrinsic Reward MethodsReinforcement Learning

  8. Does Latent Context Help? A Controlled Evaluation of Inverse Reinforcement Learning in Arctic Shipping

    Aug 6, 2026Vaishnav Vaidheeswaran, Dilith Jayakody, Biruk Ambaw +3Reinforcement LearningMeta-Reinforcement Learning

  9. Game-Theoretic Inverse Reinforcement Learning for Modeling Competitive Human Driving: A Cut-in Prediction Study

    Aug 6, 2026Yu SongReinforcement LearningAutonomous Driving

  10. ProDVI: Programmatic Dynamics Priors for Value Network Initialization

    Aug 6, 2026Xinwei Liu, Junyuan Liang, Jianting Zhang +1Reinforcement LearningLLM-Guided RL

  11. AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

    Aug 6, 2026Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao +10Agentic RLReinforcement Learning

  12. Training a Conditioned Video Game Agent on a VLM Annotated Dataset

    Aug 6, 2026Katrin Schmid, Iuri FrosioReinforcement LearningReward Design for RL

  13. Reward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement Learning

    Aug 5, 2026Jai Malegaonkar, Rohan Patil, Henrik I. ChristensenReinforcement LearningPartially Observable RL

  14. Exact Model-Free Policy Iteration for Co-safe LTL Planning

    Aug 5, 2026Zetong Xuan, Yu WangReinforcement LearningPolicy Iteration

  15. Toward Integrating Adaptive Experience Replay and Online Uncertainty Estimation in Safe Actor-Critic Optimal Control

    Aug 5, 2026Mahshad Rastegarmoghaddam, Davoud Nikkhouy, Shima SamadzadehRL ControlReinforcement Learning

  16. Calibrating Artificial Guilt: Neurally Grounded Reward Shaping for Prosocial Multi-Agent Reinforcement Learning

    Aug 5, 2026Aaditya Mehta, Arya ShahReinforcement LearningReward Shaping

  17. ATLAS: Adaptive Topological Learning with Abstract Successors for Continual Learning

    Aug 5, 2026R. Blake Lawlor, Daniel S. BrownNon-Stationary RLReinforcement Learning

  18. Adaptive Finite-Budget Training for CVaR Risk-Aware Q-Learning

    Aug 5, 2026Yifan Wu, Junjie Lei, Wenjie HuangReinforcement LearningQ-Learning

  19. Robust General Utility for Reinforcement Learning

    Aug 4, 2026Zixuan Liu, Fangzheng Wu, Brian Summa +1Stochastic OptimizationReinforcement Learning

  20. PFM-HR: Pose Flow Matching for Humanoid Robots

    Aug 4, 2026Yukang Gao, Yi Gu, Yangchen Zhou +9RL for RoboticsFlow Matching

  21. Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Reinforcement Learning

    Aug 4, 2026Subrat Prasad Panda, Blaise Genest, Arvind EaswaranReinforcement LearningSymbolic Planning

  22. SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling

    Aug 3, 2026Evan Assmus, Qining Zhang, Lei YingReinforcement LearningRobotic RL

  23. Improved Quantum Algorithms for Reinforcement Learning Under a Generative Model

    Aug 3, 2026Joao F. DoriguelloMarkov Decision ProcessesReinforcement Learning

  24. Learning-Based Collaborative MEC for LLM Inference with Soft-Deadline Awareness via Transformer-Enhanced PPO

    Aug 3, 2026Ngoc Hung Nguyen, Bjorn LandfeldtReinforcement LearningTransformer-Based RL

  25. Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning

    Aug 3, 2026Ankur Naskar, Vivek T A, Aditya Kumar +2Reinforcement LearningRisk-Sensitive RL

  26. Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning

    Aug 2, 2026Wenhao Zhang, Yibo Xie, Rui Wang +9Reinforcement LearningRL for Language Model Reasoning

  27. ReBRAC-v2: The Return of the King

    Aug 2, 2026Denis Tarasov, Robert K. KatzschmannReinforcement LearningOffline RL