Reward Design for RL

RL: Reinforcement Learning

Momentum

23 papers in the last four weeks, up 64% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 167

All topics
CardsList
  1. Intervention Complexity as a Canonical Reward and a Measure of Intelligence

    May 4, 2026Brendan McCaneAgent EvaluationReward Design for RL

  2. Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning

    May 3, 2026Arash Ahmadi, Sarah Sharif, Yaser +1Reinforcement LearningLarge Language Model-Guided Optimization

  3. MAGIC: Multi-Step Advantage-Gated Causal Influence for Multi-agent Reinforcement Learning

    May 3, 2026Haohan Yu, Jinmiao Cong, Shengzhi Wang +2Multi-Agent CoordinationIntrinsic Reward Methods

  4. Exploring Pass-Rate Reward in Reinforcement Learning for Code Generation

    May 1, 2026Xin-Ye Li, Ren-Biao Liu, Yun-Ji Zhang +3RL for Code GenerationReinforcement Learning

  5. RHyVE: Competence-Aware Verification and Phase-Aware Deployment for LLM-Generated Reward Hypotheses

    Apr 30, 2026Feiyu Wu, Xu Zheng, Zhuocheng Wang +2Reinforcement LearningLLM-Guided RL

  6. When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient

    Apr 28, 2026Shuning Shang, Hubert Strauss, Stanley Wei +2Reward ModelingPolicy Gradient

  7. How Can Reinforcement Learning Achieve Expert-level Placement?

    Apr 28, 2026Ruo-Tong Chen, Ke Xue, Chengrui Gao +7Reinforcement LearningElectronic Design Automation

  8. Zero Shot Coordination for Sparse Reward Tasks with Diverse Reward Shapings

    Apr 28, 2026Keenan Powell, Peihong Yu, Pratap TokekarMulti-Agent CoordinationReward Shaping

  9. Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning

    Apr 22, 2026Aravind Venugopal, Jiayu Chen, Xudong Wu +3Reward ShapingTemporal Credit Assignment

  10. OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning

    Apr 20, 2026Xinyu Ma, Mingzhou Xu, Xuebo Liu +4Reward ShapingRL for Language Model Reasoning

  11. Learning to Correct: Calibrated Reinforcement Learning for Multi-Attempt Chain-of-Thought

    Apr 20, 2026Muhammed Emrullah Ildiz, Halil Alperen Gozeten, Ege Onur Taga +1CoT ReasoningRL for Language Model Reasoning

  12. Fuzzy Logic Theory-based Adaptive Reward Shaping for Robust Reinforcement Learning (FARS)

    Apr 17, 2026Hürkan Şahin, Van Huyen Dang, Erdi Sayar +2Reward ShapingRobotic RL

  13. Generalizable Dense Reward for Long-Horizon Robotic Tasks

    Mar 31, 2026Silong Yong, Stephen Sheng, Carl Qi +6Reinforcement LearningLong-Horizon Robotic Manipulation

  14. Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines

    Oct 31, 2025Kristina Levina, Nikolaos Pappas, Athanasios Karapantelakis +2Reinforcement LearningQ-Learning

  15. Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning

    Oct 12, 2025Arthicha Srisuchinnawong, Poramate ManoonpongConstrained RLRL for Legged Locomotion