Sparse-Reward RL

RL: Reinforcement Learning

Momentum

19 papers in the last four weeks, up 138% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 111

All topics
CardsList
  1. Self-Retrospection Distillation: Turning Post-hoc Experiences into Prior Foresight

    Oct 6, 2026Haoxiang Zhang, Qinglin Chen, Hiroaki Hayashi +9Agentic RLRL for Language Model Reasoning

  2. Task-Space Imitation Guidance for Efficient Reinforcement Learning

    Oct 5, 2026Salar Asayesh, Hossein Darani, Todd Cao +2Reward ShapingImitation Learning

  3. Dependency-Aware Reward Shaping for Agentic Reinforcement Learning

    Oct 1, 2026Ziyi Chen, Yan Zhang, Jianhui Wei +2RL for Language ModelsAgentic RL

  4. Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL

    Sep 30, 2026Tong Zheng, Skylar Zhai, Zhan Cheng +7Multi-Objective Reinforcement LearningReinforcement Learning

  5. T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning

    Sep 30, 2026Bo-Wen Zhang, Junwei He, Maoqi Liu +6Agentic RLReward Shaping

  6. From Imitation to Reward Discovery: On-Policy Warmup for Agentic RL

    Sep 30, 2026Yitong Qiao, Tiantian He, Lei Liu +4Agentic RLReinforcement Learning with Verifiable Rewards

  7. Guide, Then Let Go: Gap-Adaptive Teacher Scheduling for Sparse-Reward Agentic RL

    Sep 29, 2026Youling Huang, Tiankuo Xu, Jiaji Liu +10Agentic RLLLM-Guided RL

  8. State Trace Rationale As Auxiliary Task in Reinforcement Learning

    Sep 29, 2026Muhammad U. Nasir, Alex Vogt, Steven D. James +1Reinforcement LearningRepresentation Learning for RL

  9. SpikeCredit: Temporal Credit Carrier for Reinforcement Learning with Sparse Rewards

    Sep 28, 2026Yingchao Yu, Pengfei Sun, Wenxuan Pan +4Credit Assignment in RLStep-Level Credit Assignment in RL

  10. TIDE: Teacher-Student Transition via Informative Distillation and Exploration for Agentic RL

    Sep 28, 2026Yibin Huang, Xinming Xu, Conghui ZhuAgentic RLOn-Policy Distillation

  11. When Sparse Reward Meets Dense Distillation: Training Dynamics of On-Policy Distillation

    Sep 28, 2026Xinke Jiang, Tao Feng, Zhibang Yang +4Gradient InterferenceReinforcement Learning with Verifiable Rewards

  12. UniOPSD: Unifying Outcome and Hindsight Feedback for Agentic Reinforcement Learning

    Sep 28, 2026Zenghuang Fu, Zhaoyang Li, Qiuyuan Ai +8Agentic RLCredit Assignment in RL

  13. Demonstration-Free Success-Probability Reward Learning for Generalist Robot Policies

    Sep 27, 2026Duo Wu, Haifeng Wang, Rongwei Lu +6Robotic RLSparse-Reward RL

  14. SAGE: Mitigating Long-Horizon Reasoning Biases via Topological Guidance

    Sep 24, 2026Xinyue Zeng, Jiawei Zhang, Yujun Yan +1Sparse-Reward RL

  15. Reinforcement Learning with Verifiable Rewards for Small Search Agents

    Sep 23, 2026Gaurisankar Jayadas, Aske Plaat, Álvaro Serra-Gómez +1Reinforcement LearningReinforcement Learning with Verifiable Rewards

  16. FLARE: A Full-Lifecycle Dense Supervision Paradigm for Long-Horizon Coding Agents via Generative Reward Model

    Sep 20, 2026Jingxuan Xu, Gang Wu, Yanan Wu +13RL for Code GenerationReward Modeling

  17. AlphaRJM: Reward-Jump Memory for Stochastic Return-Guided Alpha Discovery

    Sep 8, 2026Sayan Dhan, Selvaraju NatarajanQuantitative FinanceSparse-Reward RL

  18. Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks

    Sep 8, 2026Hongbang Yuan, Zhuoran Jin, Yixin CaoReinforcement LearningSparse-Reward RL

  19. Phase-and-First-Arrival VLM Feedback for Sparse-Reward Reinforcement Learning in Surgical Manipulation

    Sep 7, 2026Wanli Liuchen, Fangyuan Wang, Bin Li +4Reward ShapingTemporal Credit Assignment

  20. Coverage, Not Targeting: A Structural Regime in Multi-Turn Agent Credit Assignment

    Sep 2, 2026Chenyu Zhou, Qiliang Jiang, Shuning Wu +1Credit AssignmentLLM Agents

  21. Locally-Guided Actor-Critic: Training a Goal-conditioned Actor with a Subgoal-aware Critic

    Aug 31, 2026Olivier Serris, Stéphane Doncieux, Olivier SigaudReinforcement LearningSparse-Reward RL

  22. S2-HWM: Sparse Event-Structured Hierarchical World Model for Long-Horizon Surgical Robot Manipulation

    Aug 13, 2026Shuzhe Zhang, Xin Zhu, Yinling Qian +1Long-Horizon Robotic ManipulationWorld Models for Robotics

  23. I-SDPO: Instance-Level Adaptive Self-Distillation Policy Optimization

    Aug 13, 2026Yubo Zhang, Xinhong Ma, Zezhong Tan +1On-Policy Self-DistillationGroup Relative Policy Optimization

  24. Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents

    Aug 13, 2026Haoze Wu, Chuqiao Kuang, Tianyi Zhuang +1Group Relative Policy OptimizationCredit Assignment in RL

  25. Learning Loco-Manipulation From SMPC Demonstrations With Sparse Offline-to-Online RL

    Aug 12, 2026Martin Schuck, Maks Sorokin, Simone Manni +5Robot Skill LearningSparse-Reward RL

  26. Exploration-Driven Personalized Federated Reinforcement Learning via Intrinsic Motivation

    Aug 11, 2026Md Rafid Islam, Rafsan Jany, Zahid Hasan +1Federated RLIntrinsic Motivation

  27. Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning

    Aug 8, 2026Yifu Huo, Shunjie Xing, Chenglong Wang +8Agentic RLCredit Assignment in RL

  28. Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning

    Aug 7, 2026Haoyu Zheng, Yun Zhu, Qing Wang +1Agentic RLCredit Assignment in RL

  29. Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents

    Aug 7, 2026Hongxi Yan, Ziyue Huang, Shichao Fan +1Credit Assignment in RLStep-Level Credit Assignment in RL

  30. Agentic Reinforcement Learning with Self-Distilled Reward Shaping

    Aug 4, 2026Ranxu Zhang, Guinan Chen, Chenshaodong +5Reward ShapingToken-Level Credit Assignment

  31. Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Reinforcement Learning

    Aug 4, 2026Subrat Prasad Panda, Blaise Genest, Arvind EaswaranReinforcement LearningSymbolic Planning

  32. PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning

    Aug 3, 2026Chunji Lv, Yangguang Wei, Junlin Liu +6Language Model DistillationOn-Policy Distillation

  33. BiCAA: Bidirectional Credit Assignment for Search-Augmented Agent

    Aug 2, 2026Yibin Huang, Bin Xu, Hailong Cao +1Process Reward ModelsCredit Assignment in RL

  34. Explore Beyond the Boundary Using Entropic Information

    Jul 31, 2026Bumgeun Park, Donghwan LeeReinforcement LearningRL Exploration

  35. ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning

    Jul 30, 2026Zhenrong Zhang, Fei Wu, Jun Du +2RL for Language Model ReasoningCredit Assignment in RL

  36. SCOUT: Per-Context Reset Curricula for Sparse-Reward Reinforcement Learning

    Jul 29, 2026Siddharth Aphale, Ayushman SinghCurriculum RLCurriculum Learning

  37. Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning

    Jul 26, 2026Zahra Abdalla Elashaal, Afef Hfaiedh, Nahla Khraief +2Reinforcement LearningHierarchical RL

  38. LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks

    Jul 26, 2026Faraz Heravi, James Ouyang, Zifan Xu +3LLM-Guided RLRobotic Manipulation

  39. Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks

    Jul 22, 2026Kaibing Yang, Guangfeng Cai, Shengtian Yang +6Group Relative Policy OptimizationRL Exploration

  40. S3: Stable Subgoal Selection by Constraining Uncertainty of Coarse Dynamics in Hierarchical Reinforcement Learning

    Jul 21, 2026Kshitij Kumar Srivastava, Kshitij JerathHierarchical RLIntrinsic Motivation

  41. Counterfactual Shapley Credit Assignment

    Jul 18, 2026Mingxuan Li, Kai-Zhan Lee, Elias BareinboimCredit Assignment in RLTemporal Credit Assignment

  42. Reachability-Aware Pretraining for Efficient Target-Oriented Path Exploration in Temporal Knowledge Graph Reasoning

    Jul 16, 2026Chien-Liang Liu, Tsao-Lun ChenTemporal Link PredictionSparse-Reward RL

  43. SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

    Jul 16, 2026Jinyang Wu, Shuo Yang, Zhengxi Lu +8Agentic RLOn-Policy Distillation

  44. AlphaZero in Sparsely Rewarded Games: Limits and Auxiliary Supervision

    Jul 9, 2026Brent Kong, Tejas Ram, Tony Yue YuGame-Playing AgentsSelf-Play RL

  45. STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training

    Jul 6, 2026Qiuyi Qi, Tian Liang, Mutian Bao +8Uncertainty QuantificationSparse-Reward RL

  46. ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy

    Jul 3, 2026Zijun Xie, Yuyang You, Yongzhi Li +6Token-Level Credit AssignmentRL for Language Model Reasoning

  47. Hierarchical Reinforcement Learning in StarCraft Micromanagement with Influence Maps and Cluster-based Scripts

    Jun 29, 2026Chunhui Bai, Changhe Li, Dequan Li +2Hierarchical RLSparse-Reward RL

  48. KbSD: Knowledge Boundary aware Self-Distillation for Behavioral Calibration in Agentic Search

    Jun 29, 2026Tao Feng, Xinke Jiang, Chao WuLanguage Model CalibrationAgentic RAG

  49. Automating Potential-based Reward Shaping with Vision Language Model Guidance

    Jun 25, 2026Henrik Müller, Daniel KudenkoReward ShapingSparse-Reward RL

  50. Mesh-RL: Coupled subgrid reinforcement learning

    Jun 24, 2026Behnam Gheshlaghi, Bahador Rashidi, Shahin AtakishiyevReinforcement LearningCredit Assignment in RL

  51. Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents

    Jun 24, 2026Peng Xu, Sijia Chen, Junzhuo Li +1Reward ShapingCredit Assignment in RL

  52. Learning with a Single Rollout via Monte Carlo Pass@k Critic

    Jun 24, 2026Fengdi Che, Yang Liu, Lei Yu +4RL for Language Model ReasoningCredit Assignment in RL

  53. Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning

    Jun 22, 2026Yunan Wang, Minghui Song, Zihan Zhang +6Agentic RLReinforcement Learning

  54. Hierarchical Reinforcement Learning for Sparse-Reward Search in Commutative Algebra

    Jun 22, 2026Giorgi Butbaia, Paul Orland, Coco Huang +7Hierarchical RLSparse-Reward RL