Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. Redesigning Regularization for Effective Policy Smoothing

    Jun 11, 2026Taisuke Kobayashi, Naoto YamanakaReinforcement Learning

  2. SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents

    Jun 11, 2026Ziyi Wang, Yuxuan Lu, Yimeng Zhang +8AI Agent ReliabilityReinforcement Learning

  3. Learning to Adapt: Representation-Based Reinforcement Learning for Multi-Task Skill Transfer

    Jun 11, 2026Aryan Naveen, Haitong Ma, Haldun Balim +1RL for RoboticsReinforcement Learning

  4. Graph Reinforcement Learning for Calibration-Aware Quantum Circuit Routing

    Jun 11, 2026Yash Vardhan Tomar, Dheeraj PeddireddyReinforcement LearningQuantum Circuit Compilation

  5. Stubborn: A Streamlined and Unified Reinforcement Learning Framework for Robust Motion Tracking and Fall Recovery for Humanoids

    Jun 11, 2026Xiao Ren, Yuhui Yang, Zongbiao Weng +2RL for RoboticsReinforcement Learning

  6. SymQNet: Amortized Acquisition for Low-Latency Adaptive Hamiltonian Learning

    Jun 11, 2026Yash Vardhan Tomar, Dheeraj PeddireddyReinforcement LearningQuantum System Identification

  7. UniIntervene: Agentic Intervention for Efficient Real-World Reinforcement Learning

    Jun 10, 2026Haoyuan Deng, Yitong Gao, Yudong Lin +3Agentic RLReinforcement Learning

  8. The Artificial Experimentalist: Discovery and Control of Self-Organizing Phenomena with Autotelic Reinforcement Learning

    Jun 10, 2026Marko Cvjetko, Benedikt Hartl, Michael Levin +2Agentic RLReinforcement Learning

  9. The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning

    Jun 10, 2026Theo Uscidda, Marta Tintore Gazulla, Maks Ovsjanikov +2Reinforcement Learning3D Spatial Reasoning

  10. Space-sampled Value Decay: Forgetting Mechanisms for Non-stationary Deep Reinforcement Learning

    Jun 10, 2026Felix Störck, Fabian Hinder, Barbara HammerNon-Stationary RLReinforcement Learning

  11. ReCal: Reward Calibration for RL-based LLM Routing

    Jun 10, 2026Qihang Yu, Hanwen Tong, Zhengqi Zhang +5Multi-Objective Reinforcement LearningRL for Language Models

  12. IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents

    Jun 10, 2026Yifan Yang, Zhen Zhang, Jiayi Tian +2Tool Use in VLMsReinforcement Learning

  13. Learning Object Manipulation from Scratch via Contrastive Interaction

    Jun 10, 2026Tongle Shen, Caleb Chuck, Fan Feng +1Dynamical SystemsReinforcement Learning

  14. RoboNaldo: Accurate, Stable and Powerful Humanoid Soccer Shooting via Motion-Guided Curriculum Reinforcement Learning

    Jun 9, 2026Yichao Zhong, Yidan Lu, Yuhang Lu +9Reinforcement LearningRobot Skill Learning

  15. Geometrically Averaged Hard Target Updates for Linear Q-Learning

    Jun 9, 2026Donghwan LeeReinforcement LearningQ-Learning

  16. On-sky demonstration of reinforcement learning for adaptive optics control

    Jun 9, 2026Jalo Nousiainen, Vincent Chambouleyron, Benoit Neichel +7RL ControlReinforcement Learning

  17. Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training

    Jun 9, 2026João Coelho, João Magalhães, Bruno Martins +1Reinforcement LearningGroup Relative Policy Optimization

  18. Event-Driven Reinforcement Learning Enables Long-Horizon Control in Semiconductor Fabrication

    Jun 9, 2026Yavar Yeganeh, Mahsa Shekari, Nicla Frigerio +2RL ControlMulti-Objective Reinforcement Learning

  19. Convergence of Monte Carlo Optimistic Policy Iteration: Beyond Uniform State-Action Updates

    Jun 9, 2026Octave Oliviers, Glenn VinnicombeMarkov Decision ProcessesReinforcement Learning

  20. A Unified Multi-Modal Framework for Intelligent Financial Systems: Integrating Reinforcement Learning, High-Frequency Trading, and Game-Theoretic Approaches with Cross-Modal Sentiment Analysis

    Jun 9, 2026Fanrong Liu, Zhang Yuwei, Mingni LuoReinforcement LearningQuantitative Finance

  21. Claw-R1: A Step-Level Data Middleware System for Agentic Reinforcement Learning

    Jun 8, 2026Daoyu Wang, Mingyue Cheng, Qingchuan Li +3Agentic RLReinforcement Learning

  22. Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization

    Jun 7, 2026Hao Chen, Zhanming Shen, Liyao Li +8Intrinsic Reward MethodsReinforcement Learning

  23. Structure-Conditioned Actor-Critic Branches for Quality-Diversity Reinforcement Learning

    Jun 7, 2026Lianrong Zuo, Peilan Xu, Yong Liu +1Reinforcement LearningPolicy Optimization

  24. HARBOR: A Harness Framework for Agentic Robot Reinforcement Learning

    Jun 7, 2026Zechu Li, Yufeng Jin, Xiaoyang Liu +4Agentic RLReinforcement Learning

  25. Platooning Connected, Autonomous, and Human-Driven Vehicles: A Deep Reinforcement Learning-based Approach

    Jun 7, 2026Zhen Qina, Dong-Fan Xie, Heng Ma +2Reinforcement LearningIntelligent Transportation Systems

  26. GIFT: LLM-Guided State-Reward Interface for Financial Reinforcement Learning

    Jun 7, 2026Yanyan Wu, Boyi Zhang, Yanlin Liu +10Reinforcement LearningReward Shaping

  27. TT-DAC-PS: Twin-Target Deterministic Actor-Critic with Policy Smoothing for Optimal Trade Execution

    Jun 7, 2026Ilia Zaznov, Atta Badii, Julian Kunkel +1Reinforcement LearningAlgorithmic Trading