Sparse-Reward RL

RL: Reinforcement Learning

Momentum

19 papers in the last four weeks, up 138% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 111

All topics
CardsList
  1. The Two-Hump Problem: Bridging the Difficulty Gap in Mathematical Reinforcement Learning

    Jun 19, 2026Lucas Fagan, Michele Tarquini, Ali Shehper +6RL BenchmarksReinforcement Learning

  2. Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization

    Jun 19, 2026Marco Pratticò, Pietro Novelli, Massimiliano Pontil +1Reinforcement LearningExploration-Exploitation Tradeoff

  3. Evolutionary Discovery of Developmental Reward Schedules in Deep Reinforcement Learning

    Jun 18, 2026Alan Nadelsticher RuvalcabaReinforcement LearningSparse-Reward RL

  4. Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes

    Jun 15, 2026Tongyan Fang, Siyuan Huang, Naiyu Fang +6Credit Assignment in RLRobotic RL

  5. 3SPO: State-Score-Supervised Policy Optimization for LLM Agents

    Jun 8, 2026Yu Han, Kailing Li, Yang Jiao +4Credit Assignment in RLStep-Level Credit Assignment in RL

  6. Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization

    Jun 7, 2026Hao Chen, Zhanming Shen, Liyao Li +8Intrinsic Reward MethodsReinforcement Learning

  7. StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents

    Jun 5, 2026Haojie Hao, Longkun Hao, Yihang Lou +8Reinforcement LearningRL for GUI Agents

  8. Uncertainty-Aware LLM-Guided Policy Shaping for Sparse-Reward Reinforcement Learning

    Jun 4, 2026Ujjwal Bhatta, Utsabi Dangol, Sumaly Bajracharya +2Reinforcement LearningLLM-Guided RL

  9. RREDCoT: Segment-Level Reward Redistribution for Reasoning Models

    Jun 4, 2026Mykyta Ielanskyi, Kajetan Schweighofer, Lukas Aichberger +1Reinforcement LearningRL for Language Model Reasoning

  10. When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training

    Jun 4, 2026Yuanfan Li, Qi Zhou, Wenjing Duan +1Credit Assignment in RLStep-Level Credit Assignment in RL

  11. TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition

    Jun 3, 2026Ningyuan Xi, Hao Xu, Hongsheng Xin +1RL for Language Model ReasoningMathematical Reasoning

  12. Episodic Memory Temporal Consistency for Cooperative Multi-Agent Reinforcement Learning

    Jun 3, 2026Zicheng Zhao, Yu Lan, Chengzhengxu Li +2Reinforcement LearningGame-Playing Agents

  13. ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents

    Jun 2, 2026Zheng Liu, Longxiang Zhang, Xintong Wang +8Reward ModelingProcess Reward Models

  14. Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards

    Jun 1, 2026Christian Scherer, Joe Watson, Theo Gruner +3Reinforcement LearningRobot Skill Learning

  15. HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime

    May 28, 2026Mohamed Sana, Nicola Piovesan, Antonio De Domenico +2Group Relative Policy OptimizationPolicy Optimization

  16. LLM-ALSO: LLM-Driven Adaptive Learning-Signal Optimization for Multi-Agent Reinforcement Learning

    May 28, 2026Xiaoguang Wu, Zhi Zheng, Hui XiongReward ShapingLLM-Guided RL

  17. ARMS: Automatic Reward Shaping for Sparse-Reward Multi-Agent Reinforcement Learning

    May 22, 2026Elie Abboud, Oren GalMulti-Agent System OptimizationSparse-Reward RL

  18. PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization

    May 18, 2026Wonjoong Kim, Yeonjun In, Sangwu Park +2Reward ModelingCredit Assignment in RL

  19. Mind Dreamer: Untethering Imagination via Active Causal Intervention on Latent Manifolds

    May 15, 2026Shaojun Xu, Xiaoling Zhou, Yihan Lin +4Reinforcement LearningCredit Assignment in RL

  20. Offline Policy Evaluation for Manipulation Policies via Discounted Liveness Formulation

    May 12, 2026Hao Wang, Joshua Bowden, Colton Crosby +1RL for RoboticsReinforcement Learning

  21. XQCfD: Accelerating Fast Actor-Critic Algorithms with Prior Data and Prior Policies

    May 11, 2026Daniel Palenicek, Florian Vogt, Joe Watson +3Robotic RLLearning from Demonstration

  22. PhysEDA: Physics-Aware Learning Framework for Efficient EDA With Manhattan Distance Decay

    May 11, 2026Zetao YangEfficient Neural Network InferenceReward Shaping