Reinforcement Learning

Also known as RL

Momentum

144 papers in the last four weeks, up 243% on the four weeks before. 1.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,147

All topics
CardsList
  1. Transferable Delay-Aware Reinforcement Learning via Implicit Causal Graph Modeling

    May 12, 2026Chenran Zhao, Dianxi Shi, Yaowen Zhang +2Causal Representation LearningReinforcement Learning

  2. Delay-Empowered Causal Hierarchical Reinforcement Learning

    May 12, 2026Chenran Zhao, Dianxi Shi, Haotian Wang +4Reinforcement LearningHierarchical RL

  3. Intrinsic Vicarious Conditioning for Deep Reinforcement Learning

    May 12, 2026Rodney A Sanchez, Ferat Sahin, Alex Ororbia +1Reinforcement LearningIntrinsic Motivation

  4. On the Importance of Multistability for Horizon Generalization in Reinforcement Learning

    May 12, 2026Asad Bakija, Florent De Geeter, Julien Brandoit +2Dynamical SystemsReinforcement Learning

  5. Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction

    May 12, 2026Zhong Guan, Yongjian Guo, Haoran Sun +5Asynchronous RLReinforcement Learning

  6. Learning Agentic Policy from Action Guidance

    May 12, 2026Yuxiang Ji, Zengbin Wang, Yong Wang +6Agentic RLReinforcement Learning

  7. From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation

    May 12, 2026Guobin Shen, Lei Huang, Xiang Cheng +4Reinforcement LearningOn-Policy Self-Distillation

  8. CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG

    May 12, 2026Jianghan Shen, Siqi Luo, Xinyu Cheng +6RL for Language ModelsReinforcement Learning

  9. Taming Extreme Tokens: Covariance-Aware GRPO with Gaussian-Kernel Advantage Reweighting

    May 12, 2026Cheng Wang, Qin Liu, Wenxuan Zhou +1Reinforcement LearningRL for Language Model Reasoning

  10. Selective Off-Policy Reference Tuning with Plan Guidance

    May 12, 2026Duc Anh Le, Tien-Phat Nguyen, Thien Huu Nguyen +2Reinforcement LearningRL for Language Model Reasoning

  11. Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization

    May 12, 2026Huimin Xu, Shuai Zhao, Xiaobao Wu +1Reinforcement LearningRL for Language Model Reasoning

  12. Offline Policy Evaluation for Manipulation Policies via Discounted Liveness Formulation

    May 12, 2026Hao Wang, Joshua Bowden, Colton Crosby +1RL for RoboticsReinforcement Learning

  13. Behavioral Mode Discovery for Fine-tuning Multimodal Generative Policies

    May 12, 2026Alberta Longhini, David Emukpere, Jean-Michel Renders +1RL for RoboticsReinforcement Learning

  14. Quotient-Categorical Representations for Bellman-Compatible Average-Reward Distributional Reinforcement Learning

    May 11, 2026Ege C. Kaya, Aliasghar Pourghani, Vijay Gupta +1Distributional RLReinforcement Learning

  15. Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning

    May 11, 2026Han Zheng, Yining Ma, Karthick Gunasekaran +4Reinforcement LearningMeta-Learning

  16. Equivariant Reinforcement Learning for Clifford Quantum Circuit Synthesis

    May 11, 2026Richie Yeung, Aleks Kissinger, Rob CornishReinforcement LearningQuantum Circuit Compilation

  17. RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards

    May 11, 2026Gaotang Li, Bhavana Dalvi Mishra, Zifeng Wang +9Reinforcement LearningRubric-Based RL

  18. UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation

    May 11, 2026Junjie Lu, Xinyao Qin, Yuhua Jiang +6RL for RoboticsRobot Policy Adaptation

  19. Policy Gradient Methods for Non-Markovian Reinforcement Learning

    May 11, 2026Avik Kar, Siddharth Chandak, Rahul Singh +4Reinforcement LearningPolicy Gradient Methods

  20. Natural Policy Gradient as Doubly Smoothed Policy Iteration: A Bellman-Operator Framework

    May 11, 2026Phalguni Nanda, Zaiwei ChenPolicy GradientReinforcement Learning

  21. Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents

    May 11, 2026Zhiyuan Fan, Wenwei Jin, Feng Zhang +4Reinforcement LearningLanguage Model Self-Improvement

  22. EFGCL: Learning Dynamic Motion through Spotting-Inspired External Force Guided Curriculum Learning

    May 11, 2026Keita Yoneda, Kento Kawaharazuka, Kei OkadaReinforcement LearningWhole-Body Control

  23. Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward

    May 11, 2026Xuexiang Wen, Hang Yu, Linchao Zhu +1Intrinsic Reward MethodsReinforcement Learning