Reward Design for RL

RL: Reinforcement Learning

Momentum

23 papers in the last four weeks, up 64% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 167

All topics
CardsList
  1. Beyond Outcome Rewards: Constructing and Assigning Retrieval Credit for Search Agents

    Oct 7, 2026Wenyu Huang, Xinyu Hou, Pavlos Vougiouklis +2Reward Design for RLRL for IR

  2. When Do Intrinsic Rewards Lead to Exploration?

    Oct 1, 2026Scott W. Viteri, Laura Gomezjurado Gonzalez, Clark BarrettIntrinsic Reward MethodsRL Exploration

  3. PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading

    Oct 1, 2026Duong Hien Chi Kien, Thanh Trung HuynhReinforcement LearningRisk-Sensitive RL

  4. Dependency-Aware Reward Shaping for Agentic Reinforcement Learning

    Oct 1, 2026Ziyi Chen, Yan Zhang, Jianhui Wei +2RL for Language ModelsAgentic RL

  5. CATCH: A Controllable Analysis Testbed for Reward Hacking in Coding RL

    Sep 30, 2026Shouli Wang, Yanfeng Jia, Zhihao Ou +6RL BenchmarksRL for Code Generation

  6. CAST: Causal Advantage-Structured Training with Spatially Grounded Compositional Rewards for Diffusion Models

    Sep 30, 2026Shu Yu, Chaochao LuDiffusion Model Fine-TuningCompositional T2I Generation

  7. Group-Marginalized Self-Rewarding RL Drives Zero-Label Self-Evolving

    Sep 29, 2026Yiming Wang, Yikang Liu, Qingyuan Tian +4RL for Language ModelsReinforcement Learning

  8. Verifier Errors in RLVR: Reward Hacking, Limits of Feedback, and Selective Control

    Sep 28, 2026Christian Moya, Elliott Thornley, Guang LinReward HackingReinforcement Learning

  9. Rubric Rewards from Item Response Theory

    Sep 28, 2026Milad Yazdani, Yaser Souri, Xiren Zhou +4Reward ModelingRubric-Based RL

  10. Sufficiency of Zeroth-Order Reward Shaping for Policy Gradient in Stabilization Control

    Sep 28, 2026Yisheng Zhang, Tao Wang, Sicun GaoReward ShapingRobotic RL

  11. CRISP: Cultural Reward Modeling for Implicit Situated Propriety

    Sep 28, 2026Zekun Yuan, Yangfan Ye, Baohang Li +6Reward ModelingRL for Language Models

  12. Evolving Support Priorities in Empathetic Reinforcement Learning

    Sep 28, 2026Pengyu Huang, Zhiyuan Han, Wenwen Tong +6Reward ModelingRL for Language Models

  13. Demonstration-Free Success-Probability Reward Learning for Generalist Robot Policies

    Sep 27, 2026Duo Wu, Haifeng Wang, Rongwei Lu +6Robotic RLSparse-Reward RL

  14. Reinforcement Learning with Verifiable Rewards for Small Search Agents

    Sep 23, 2026Gaurisankar Jayadas, Aske Plaat, Álvaro Serra-Gómez +1Reinforcement LearningReinforcement Learning with Verifiable Rewards

  15. DCRL: Decoupling and Coupling Reinforcement Learning via Policy-Reward Manifold Alignment

    Sep 23, 2026Henan Sun, Zehua Li, Haitao Hu +4Reinforcement LearningRL for Language Model Reasoning

  16. Sometimes You Gotta Run Before You Can Walk: Run-then-Walk Scheduling Strategy for VLM Autonomous Driving

    Sep 22, 2026Yuqi Ye, Shangkun Sun, Junhong Lin +6VLMs for Autonomous DrivingGroup Relative Policy Optimization

  17. RLVR2^{2}: Reinforcement Learning with Verifiable Rubric-based Ranking

    Sep 20, 2026Hao Li, Zhengkun Zhang, Gangqiang Hu +4Learning to RankRubric-Based RL

  18. Mitigating Retaliatory Algorithmic Collusion in Repeated Games

    Sep 17, 2026Karthik Sivachandran, Rohan PalejaGame-Playing AgentsRepeated Games

  19. Flow-Matched Motion Priors: Online Optimal-Transport Rewards for Imitation Learning

    Sep 14, 2026Yilin Zou, Chenghua Liu, Chenglong Wu +1Imitation LearningRL for Legged Locomotion

  20. Specifying Reward Functions for RL Without Environment Sampling

    Sep 14, 2026Stephane Hatgis-Kessell, W. Bradley Knox, Emma BrunskillLLM-Guided RLReward Design for RL

  21. EvoRS: On-Policy Self-Evolution of Reward Systems for Open-Ended Reinforcement Learning

    Sep 14, 2026Weiyuan Li, Aili Chen, Xintao Wang +11Reward HackingReinforcement Learning

  22. From Connectivity to Rewards: Dense Reward Learning with Directed State Graphs

    Sep 11, 2026Shuyuan Zhang, Zihan Wang, Xiao-Wen Chang +1Reinforcement LearningHierarchical RL

  23. Spurious Advantage Hidden in GRPO

    Sep 3, 2026Jiamian Wang, Samyadeep Basu, Koustava Goswami +2Reinforcement LearningGroup Relative Policy Optimization

  24. GDB-Reward: From Evaluation Metrics to Training Rewards for Graphic Design

    Sep 2, 2026Adrienne Deganutti, Purvanshi Mehta, Simon Hadfield +1Reward Design for RLPrompt Optimization for T2I Generation

  25. Dense Process Supervision for Search Agents via Fact Utility Estimation

    Sep 1, 2026Rongzhi Zhu, Xiangyu Liu, Yi Liu +7Reinforcement LearningCredit Assignment in RL

  26. What Emerges and What Breaks in Self-Play Driving

    Aug 31, 2026Laur Sisask, Ardi Tampuu, Tambet MatiisenReward HackingSelf-Play RL

  27. Locally-Guided Actor-Critic: Training a Goal-conditioned Actor with a Subgoal-aware Critic

    Aug 31, 2026Olivier Serris, Stéphane Doncieux, Olivier SigaudReinforcement LearningSparse-Reward RL