Reward Shaping

Momentum

12 papers in the last four weeks, up 300% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 89

All topics
CardsList
  1. Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning

    Jul 21, 2026Lizhe Fang, Weizhou Shen, Tianyi Tang +1LLM GroundingReward Shaping

  2. LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning

    Jul 19, 2026Xingjian Tao, Yiwei Wang, Yujun Cai +1Visual Spatial ReasoningReward Shaping

  3. Foresight Residual RL for Long-Horizon Robot Manipulation with Vision-Language-Action Models

    Jul 17, 2026Yuhan Liu, Xinyu Zhang, Litao Liu +1Reward ShapingLong-Horizon Robotic Manipulation

  4. SCOPE-RL: Optimizing Reasoning Paths Before and After Success

    Jul 13, 2026Xiaojian Liu, Han Xu, Jianqiang Xia +6Reward ShapingRL for Language Model Reasoning

  5. Regime-Conditional Stabilisation of LLM-Augmented Cooperative Multi-Agent Reinforcement Learning

    Jul 5, 2026Faid Keddouri, Sohaib Houhou, Aissa Boulmerka +1Reward ShapingLLM-Guided RL

  6. UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

    Jun 30, 2026Yaozhi Zheng, Yilei Jiang, Manyuan Zhang +5RL for Code GenerationReinforcement Learning

  7. Designing Reward Signals for Portable Query Generation: A Case Study in Industrial Semantic Job Search

    Jun 25, 2026Ping Liu, Qianqi Shen, Jianqiang Shen +11Reward HackingReward Shaping

  8. Automating Potential-based Reward Shaping with Vision Language Model Guidance

    Jun 25, 2026Henrik Müller, Daniel KudenkoReward ShapingSparse-Reward RL

  9. Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy

    Jun 25, 2026Wenjie Huang, Yang Li, Jingjia Teng +6Reinforcement LearningReward Shaping

  10. Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents

    Jun 24, 2026Peng Xu, Sijia Chen, Junzhuo Li +1Reward ShapingCredit Assignment in RL

  11. Reward-Conditioned Attention: How Reward Design Shapes What Autonomous Driving Agents See

    Jun 23, 2026Mohamed Benabdelouahad, Ahmed Djalal Hacini, Nadir Farhi +1Reward ShapingRL for Autonomous Driving

  12. A Reward-Petri-Net Interpretation of Temporal Behavior Trees

    Jun 19, 2026Till Schmeil, Günther Waxenegger-Wilfing, Sebastian SchirmerReinforcement LearningReward Shaping

  13. CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs

    Jun 18, 2026Chengwen Liu, Hao Peng, Jisheng Dang +3Reward ShapingVideo Reasoning

  14. Model-Free Reinforcement Learning Control for Resilient Cyber-Physical Systems

    Jun 17, 2026Hugo O. Garcés, Alejandro J. Rojas, Bernardo A. Hernández +5RL ControlCyber-Physical Systems

  15. PathRouter: Aligning Rewards with Retrieval Quality in Agentic Graph Retrieval-Augmented Generation

    Jun 15, 2026Bo Wang, Heyan Huang, Yaolin Li +6Reward ShapingGraph Retrieval-Augmented Generation

  16. Evolutionary Bilevel Reward Shaping for Generalization in Reinforcement Learning

    Jun 15, 2026Ekasit Usaratniwart, Xilin Gao, Marc Ong +1Reinforcement LearningReward Shaping

  17. Retrospective Progress-Aware Self-Refinement for LLM Agent Training

    Jun 12, 2026Xinbei Ma, Congmin Zheng, Jiyang Qiu +11Reward ShapingLLM Agent Training

  18. Can the Environment Speak for Itself? T2T^{2}-GRPO: A Turn-Trajectory Group Relative Policy Optimization for Caregiver Agents

    Jun 7, 2026Yutong Song, Jiang Wu, Pengfei Zhang +4Reward ShapingHealthcare

  19. GIFT: LLM-Guided State-Reward Interface for Financial Reinforcement Learning

    Jun 7, 2026Yanyan Wu, Boyi Zhang, Yanlin Liu +10Reinforcement LearningReward Shaping

  20. ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning

    Jun 6, 2026Qing Miao, Yiming Zhao, Jing Yang +5Reward ShapingRL for Language Model Reasoning

  21. Predictive Style Matching: Natural and Robust Humanoid Locomotion

    Jun 5, 2026Simeon Nedelchev, Ekaterina Chaikovskaia, Egor Davydenko +2Humanoid Robot LocomotionReward Shaping

  22. Feat2Go: Visual Feature-Grounded Value Estimation for Embodied Reinforcement Learning

    May 29, 2026Junyang Shu, Zhiwei Lin, Bingqing Wei +1Reward ShapingValue Function Estimation

  23. Momentum Based Reward Design for Low Emission Traffic Signal Control

    May 28, 2026Chinmay Mundane, Amith Manoharan, Arun Kumar SinghReinforcement LearningReward Shaping