Sparse-Reward RL

RL: Reinforcement Learning

Momentum

19 papers in the last four weeks, up 138% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 111

All topics
CardsList
  1. MSPR: Multi-scale Predictive Representations for Goal-conditioned Reinforcement Learning

    May 10, 2026Valliappan Chidambaram Adaikkappan, Sai Rajeswar, Pietro Mazzaglia +1Offline RLPredictive Representation Learning

  2. Functional Graphs for Predicting and Explaining Goal Failure in Sparse Goal-Conditioned RL

    May 10, 2026Shalley DashReinforcement LearningSparse-Reward RL

  3. PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning

    May 10, 2026Dongyi Liu, Yifan Niu, Qinwen Wang +2Reinforcement LearningReward Shaping

  4. Learning CLI Agents with Structured Action Credit under Selective Observation

    May 8, 2026Haoyang Su, Ying WenComputer-Use AgentsCredit Assignment in RL

  5. Soft Deterministic Policy Gradient with Gaussian Smoothing

    May 7, 2026Hyunjun Na, Donghwan LeeRL ControlPolicy Gradient

  6. QHyer: Q-conditioned Hybrid Attention-mamba Transformer for Offline Goal-conditioned RL

    May 3, 2026Xing Lei, Jincheng Wang, Xuetao Zhang +1Offline RLSparse-Reward RL

  7. Joint Energy Management and Coordinated AIGC Workload Scheduling for Distributed Data Centers: A Diffusion-Aided Reward Shaping Approach

    May 3, 2026Yang Fu, Peng Qin, Liming Chen +3Reward ShapingCost-Aware Inference

  8. S3S^3-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data

    May 2, 2026Harsh Goel, Akhil Udathu, Susmija Jabbireddy +2Multi-Hop QASynthetic Data Generation

  9. AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning

    May 1, 2026Haotian Zhao, Songlin Zhou, Yuxin Zhang +9Agentic RLCredit Assignment in RL

  10. Sample-efficient Neuro-symbolic Proximal Policy Optimization

    Apr 28, 2026Simone Murari, Celeste Veronese, Daniele MeliReinforcement LearningProximal Policy Optimization

  11. Zero Shot Coordination for Sparse Reward Tasks with Diverse Reward Shapings

    Apr 28, 2026Keenan Powell, Peihong Yu, Pratap TokekarMulti-Agent CoordinationReward Shaping

  12. Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning

    Apr 22, 2026Aravind Venugopal, Jiayu Chen, Xudong Wu +3Reward ShapingTemporal Credit Assignment

  13. Reducing Credit Assignment Variance via Counterfactual Reasoning Paths

    Apr 20, 2026Fei Ding, Yongkang Zhang, Youwei Wang +1RL for Language Model ReasoningCredit Assignment in RL

  14. P^2O: Joint Policy and Prompt Optimization

    Mar 23, 2026Xinyu Lu, Kaiqi Zhang, Jinglin Yang +6RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  15. TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents

    Feb 12, 2026Aladin Djuhera, Swanand Kadhe, Farhan Ahmed +3Tree SearchLLM Agent Training

  16. Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability

    Jan 26, 2026Shobhita Sundaram, John Quan, Ariel Kwiatkowski +3Self-Play RLRL for Language Model Reasoning

  17. Self-Supervised Goal-Reaching Results in Multi-Agent Cooperation and Exploration

    Sep 12, 2025Chirayu Nimonkar, Shlok Shah, Catherine Ji +1Multi-Agent CoordinationRL Exploration

  18. CONTHER: Context-Aware Reinforcement Learning for Robotic Manipulation with Sparse Rewards

    Mar 20, 2025Maria Makarova, Qian Liu, Dzmitry TsetserukouReinforcement LearningExperience Replay