Sparse-Reward RL

RL: Reinforcement Learning

Momentum

19 papers in the last four weeks, up 138% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 111

All topics
CardsList
  1. Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning

    Aug 7, 2026Haoyu Zheng, Yun Zhu, Qing Wang +1Agentic RLCredit Assignment in RL

  2. Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents

    Aug 7, 2026Hongxi Yan, Ziyue Huang, Shichao Fan +1Credit Assignment in RLStep-Level Credit Assignment in RL

  3. Agentic Reinforcement Learning with Self-Distilled Reward Shaping

    Aug 4, 2026Ranxu Zhang, Guinan Chen, Chenshaodong +5Reward ShapingToken-Level Credit Assignment

  4. Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Reinforcement Learning

    Aug 4, 2026Subrat Prasad Panda, Blaise Genest, Arvind EaswaranReinforcement LearningSymbolic Planning

  5. PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning

    Aug 3, 2026Chunji Lv, Yangguang Wei, Junlin Liu +6Language Model DistillationOn-Policy Distillation

  6. BiCAA: Bidirectional Credit Assignment for Search-Augmented Agent

    Aug 2, 2026Yibin Huang, Bin Xu, Hailong Cao +1Process Reward ModelsCredit Assignment in RL

  7. Explore Beyond the Boundary Using Entropic Information

    Jul 31, 2026Bumgeun Park, Donghwan LeeReinforcement LearningRL Exploration

  8. ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning

    Jul 30, 2026Zhenrong Zhang, Fei Wu, Jun Du +2RL for Language Model ReasoningCredit Assignment in RL

  9. SCOUT: Per-Context Reset Curricula for Sparse-Reward Reinforcement Learning

    Jul 29, 2026Siddharth Aphale, Ayushman SinghCurriculum RLCurriculum Learning

  10. Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning

    Jul 26, 2026Zahra Abdalla Elashaal, Afef Hfaiedh, Nahla Khraief +2Reinforcement LearningHierarchical RL

  11. LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks

    Jul 26, 2026Faraz Heravi, James Ouyang, Zifan Xu +3LLM-Guided RLRobotic Manipulation

  12. Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks

    Jul 22, 2026Kaibing Yang, Guangfeng Cai, Shengtian Yang +6Group Relative Policy OptimizationRL Exploration

  13. S3: Stable Subgoal Selection by Constraining Uncertainty of Coarse Dynamics in Hierarchical Reinforcement Learning

    Jul 21, 2026Kshitij Kumar Srivastava, Kshitij JerathHierarchical RLIntrinsic Motivation

  14. Counterfactual Shapley Credit Assignment

    Jul 18, 2026Mingxuan Li, Kai-Zhan Lee, Elias BareinboimCredit Assignment in RLTemporal Credit Assignment

  15. Reachability-Aware Pretraining for Efficient Target-Oriented Path Exploration in Temporal Knowledge Graph Reasoning

    Jul 16, 2026Chien-Liang Liu, Tsao-Lun ChenTemporal Link PredictionSparse-Reward RL

  16. SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

    Jul 16, 2026Jinyang Wu, Shuo Yang, Zhengxi Lu +8Agentic RLOn-Policy Distillation

  17. AlphaZero in Sparsely Rewarded Games: Limits and Auxiliary Supervision

    Jul 9, 2026Brent Kong, Tejas Ram, Tony Yue YuGame-Playing AgentsSelf-Play RL

  18. STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training

    Jul 6, 2026Qiuyi Qi, Tian Liang, Mutian Bao +8Uncertainty QuantificationSparse-Reward RL

  19. ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy

    Jul 3, 2026Zijun Xie, Yuyang You, Yongzhi Li +6Token-Level Credit AssignmentRL for Language Model Reasoning

  20. Hierarchical Reinforcement Learning in StarCraft Micromanagement with Influence Maps and Cluster-based Scripts

    Jun 29, 2026Chunhui Bai, Changhe Li, Dequan Li +2Hierarchical RLSparse-Reward RL

  21. KbSD: Knowledge Boundary aware Self-Distillation for Behavioral Calibration in Agentic Search

    Jun 29, 2026Tao Feng, Xinke Jiang, Chao WuLanguage Model CalibrationAgentic RAG

  22. Automating Potential-based Reward Shaping with Vision Language Model Guidance

    Jun 25, 2026Henrik Müller, Daniel KudenkoReward ShapingSparse-Reward RL

  23. Mesh-RL: Coupled subgrid reinforcement learning

    Jun 24, 2026Behnam Gheshlaghi, Bahador Rashidi, Shahin AtakishiyevReinforcement LearningCredit Assignment in RL

  24. Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents

    Jun 24, 2026Peng Xu, Sijia Chen, Junzhuo Li +1Reward ShapingCredit Assignment in RL

  25. Learning with a Single Rollout via Monte Carlo Pass@k Critic

    Jun 24, 2026Fengdi Che, Yang Liu, Lei Yu +4RL for Language Model ReasoningCredit Assignment in RL

  26. Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning

    Jun 22, 2026Yunan Wang, Minghui Song, Zihan Zhang +6Agentic RLReinforcement Learning

  27. Hierarchical Reinforcement Learning for Sparse-Reward Search in Commutative Algebra

    Jun 22, 2026Giorgi Butbaia, Paul Orland, Coco Huang +7Hierarchical RLSparse-Reward RL