Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,138

All topics
CardsList
  1. A Convergence Framework for Deep VV-Learning: Error Propagation and Sharp Action-Gap Bounds

    Sep 16, 2026Yury KolomeytsevReinforcement LearningPolicy Learning

  2. DistAL: Distance-based Advantage Learning for VLA Fine-Tuning

    Sep 16, 2026Reece O'Mahoney, Ioannis HavoutisReinforcement LearningReward Shaping

  3. The Free Inference Dimension: Complexity Measure for Zero-Collision Navigation under Hypothesis Mixtures

    Sep 15, 2026Luiz Carlos Castro Guedes, Edward Hermann HaeuslerReinforcement LearningMeta-Reinforcement Learning

  4. SAiFE-gym: Model-based Environments for Automated Market Making with Concentrated Liquidity

    Sep 15, 2026Georgios Chionas, Charalampos Kleitsikas, Stefanos Leonardos +2Reinforcement LearningDecentralized Finance

  5. Composite-Gradient Learning for Shared Control Authority Between Deep Reinforcement Learning and Model Predictive Control

    Sep 15, 2026Giray Önür, Azita Dabiri, Bart De SchutterRL ControlReinforcement Learning

  6. Towards Surrogate Based Dequantization of Quantum Reinforcement Learning

    Sep 14, 2026Pablo Rodriguez-Grasa, Sofiene Jerbi, Mikel Sanz +1Reinforcement LearningQ-Learning

  7. A neural-astrocyte architecture implements a hybrid automaton for evidence accumulation

    Sep 14, 2026Giacomo Vedovati, Ilya E. Monosov, Thomas J. Papouin +1Dynamical SystemsReinforcement Learning

  8. Bellman Policy Optimization

    Sep 14, 2026Zhuoqing Song, Haotian Xu, Xikun Zhang +1Reinforcement LearningRL for Language Model Reasoning

  9. Adaptive Chemotherapy Control under Tumor Heterogeneity via Reinforcement Learning

    Sep 14, 2026Bereket Sitotaw Kidane, Md Samiul Haque Motayed, Shuo WangRL ControlReinforcement Learning

  10. VRL-Bench: Benchmarking agents on computer control tasks under finite trial budgets

    Sep 14, 2026Yu Bai, Yukai Miao, Dawei Wang +8RL BenchmarksReinforcement Learning

  11. MInTRL: Off-policy Intervention can boost On-policy RL

    Sep 14, 2026Mingyu Chen, Yefan Tao, Gerald Friedland +2Reinforcement LearningReinforcement Learning with Verifiable Rewards

  12. EvoRS: On-Policy Self-Evolution of Reward Systems for Open-Ended Reinforcement Learning

    Sep 14, 2026Weiyuan Li, Aili Chen, Xintao Wang +11Reward HackingReinforcement Learning

  13. Adaptive Agent Design

    Sep 14, 2026Raj Kiriti Velicheti, Subhonmesh Bose, Tamer BaşarReinforcement LearningQ-Learning

  14. Offline Reinforcement Learning for Wind Farm Control: A Wind Tunnel Study under Dynamic Wind Directions

    Sep 14, 2026Yuhan Su, Hongyang Dong, Simone Tamaro +3RL ControlReinforcement Learning

  15. Groupoid-Based Internal State Representations for Reinforcement Learning with Local Symmetries

    Sep 14, 2026Ben Opperman, Eduardo Alonso, Esther MondragónReinforcement LearningState Representation Learning

  16. Expert-Space Exploration in MoE Reinforcement Learning

    Sep 14, 2026Hongyi He, Zhenghao Lin, Xiao Liu +3Reinforcement LearningExpert Routing

  17. Learning to Solve Stochastic Controls with Unknown Drifts and Running Rewards: Theory, Algorithms and Convergence

    Sep 14, 2026Jin Ma, Gaozhan Wang, Jianfeng Zhang +1Reinforcement LearningStochastic Optimal Control

  18. HiGFRL: Hierarchical Graph Fusion-Driven Reinforcement Learning for Dependency-Aware Task Scheduling in Heterogeneous Cloud

    Sep 14, 2026Tiangang Li, Shi Ying, Xiangbo TianReinforcement LearningHeterogeneous Computing

  19. A Bellman Optimality Equation for Plasticity

    Sep 11, 2026Jeremy Lucas, Doina PrecupStability-Plasticity DilemmaReinforcement Learning

  20. From Connectivity to Rewards: Dense Reward Learning with Directed State Graphs

    Sep 11, 2026Shuyuan Zhang, Zihan Wang, Xiao-Wen Chang +1Reinforcement LearningHierarchical RL

  21. Near-Optimal Reinforcement Learning with Multi-Step Transition Lookahead

    Sep 10, 2026Corentin Pla, Hugo Richard, Marc Abeille +1Reinforcement LearningApproximation Algorithms

  22. InstantMimic: A High Performance System for Learning Physics-based Skills in Seconds

    Sep 9, 2026Ikjun Choi, Geonho Leem, Jungdam WonReinforcement LearningImitation Learning