Reward Shaping

Momentum

12 papers in the last four weeks, up 300% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 89

All topics
CardsList
  1. Ask the Expert: LLM-Guided Reinforcement Learning for Autonomous Cyber Defense

    Oct 7, 2026Fernando Martinez, Abhishek Satyam, Tao Li +3Autonomous Cyber DefenseLLM-Guided RL

  2. Task-Space Imitation Guidance for Efficient Reinforcement Learning

    Oct 5, 2026Salar Asayesh, Hossein Darani, Todd Cao +2Reward ShapingImitation Learning

  3. Dependency-Aware Reward Shaping for Agentic Reinforcement Learning

    Oct 1, 2026Ziyi Chen, Yan Zhang, Jianhui Wei +2RL for Language ModelsAgentic RL

  4. T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning

    Sep 30, 2026Bo-Wen Zhang, Junwei He, Maoqi Liu +6Agentic RLReward Shaping

  5. ReF-HIL: Shaping the Critic around Human Action Neighborhoods for Efficient Human-in-the-Loop Reinforcement Learning

    Sep 29, 2026Shaoyin Luo, Song Wang, Shibo Xia +5RL for RoboticsReward Shaping

  6. StructRL: Online Structured Reinforcement Learning for Long-Horizon Vision-Language-Action Tasks

    Sep 28, 2026Ziyi Yin, Sangmin Woo, Kang Zhou +4Reward ShapingLong-Horizon Robotic Manipulation

  7. Quality Determines Direction, Length Shapes Magnitude: Length Control for Open-Ended Reinforcement Learning

    Sep 28, 2026Zijun Weng, Zhongan Bi, Xuanang Gao +5Open-Ended GenerationRL for Language Models

  8. Sufficiency of Zeroth-Order Reward Shaping for Policy Gradient in Stabilization Control

    Sep 28, 2026Yisheng Zhang, Tao Wang, Sicun GaoReward ShapingRobotic RL

  9. FIERCE: From Generalist Robot Policies to Fast Specialists via Progress-Failure Feedback

    Sep 16, 2026Runjia Tan, Yuang Tu, Yujie Yan +3Reward ModelingRobot Policy Learning

  10. DistAL: Distance-based Advantage Learning for VLA Fine-Tuning

    Sep 16, 2026Reece O'Mahoney, Ioannis HavoutisReinforcement LearningReward Shaping

  11. Long-Horizon Language Model Reinforcement Learning via Progressive Point Matching

    Sep 7, 2026Preston Fu, Kevin Frans, Oleh Rybkin +2Reinforcement LearningReward Shaping

  12. Phase-and-First-Arrival VLM Feedback for Sparse-Reward Reinforcement Learning in Surgical Manipulation

    Sep 7, 2026Wanli Liuchen, Fangyuan Wang, Bin Li +4Reward ShapingTemporal Credit Assignment

  13. Gradients Know What Outcomes Don't: Unlocking Reinforcement Learning for LLM Reasoning with Gradient-Aligned Rewards

    Sep 3, 2026Leqi Zheng, Jinbo Su, Fang Niu +8Numerical Reasoning in Language ModelsReward Shaping

  14. Cliff: Learning Process Rewards from the First Mistake

    Sep 2, 2026Peixuan Han, Runhui Wang, Ketan Ramaneti +3Reinforcement Learning with Verifiable RewardsLLM Reasoning

  15. ERR+: Sequential Entropy Resolution for Efficient and Decisive LLM Reasoning

    Aug 28, 2026Xin Jiang, Minhao Wang, Wen Wu +4Reward ShapingRL for Language Model Reasoning

  16. A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning

    Aug 8, 2026Fouad BahrpeymaReward ShapingReward Design for RL

  17. Enhancing Social Intelligence in LLMs with Hierarchical Reasoning and Utterance-Level Goal Rewarding

    Aug 6, 2026Xiaofeng Wang, Kakam Chong, Shuai Xiao +9Reward ShapingHierarchical RL

  18. Calibrating Artificial Guilt: Neurally Grounded Reward Shaping for Prosocial Multi-Agent Reinforcement Learning

    Aug 5, 2026Aaditya Mehta, Arya ShahReinforcement LearningReward Shaping

  19. Agentic Reinforcement Learning with Self-Distilled Reward Shaping

    Aug 4, 2026Ranxu Zhang, Guinan Chen, Chenshaodong +5Reward ShapingToken-Level Credit Assignment

  20. PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent

    Aug 2, 2026Sudipta Paul, Vijay Srinivasan, Vivek Kulkarni +4Reward ShapingLLM-Guided RL

  21. Minute-Scale Training for Microrobot Navigation

    Aug 1, 2026Yinghan Sun, Aoji Zhu, Xiang Ji +6Reward ShapingRobot Navigation

  22. DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards

    Aug 1, 2026Yunhao Wang, Binghong Wu, Zhenyu Huang +4Reward ShapingDocument Parsing

  23. TaPR: Test-Aware Policy Refinement for Feedback-Conditioned Code Generation

    Aug 1, 2026Aofan Liu, Jingxiang Meng, Fangxin Liu +1RL for Code GenerationReward Shaping

  24. RMSWeb: Reflection, Failure-Mode Mining, and Salvage-DS for Web Agent Reinforcement Learning

    Jul 31, 2026Chengbo Liu, Lifang Zhou, Ruijie Yan +8Reward ShapingOffline RL