Reward Design for RL

RL: Reinforcement Learning

Momentum

23 papers in the last four weeks, up 64% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 167

All topics
CardsList
  1. Beyond Outcome Rewards: Constructing and Assigning Retrieval Credit for Search Agents

    Oct 7, 2026Wenyu Huang, Xinyu Hou, Pavlos Vougiouklis +2Reward Design for RLRL for IR

  2. When Do Intrinsic Rewards Lead to Exploration?

    Oct 1, 2026Scott W. Viteri, Laura Gomezjurado Gonzalez, Clark BarrettIntrinsic Reward MethodsRL Exploration

  3. PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading

    Oct 1, 2026Duong Hien Chi Kien, Thanh Trung HuynhReinforcement LearningRisk-Sensitive RL

  4. Dependency-Aware Reward Shaping for Agentic Reinforcement Learning

    Oct 1, 2026Ziyi Chen, Yan Zhang, Jianhui Wei +2RL for Language ModelsAgentic RL

  5. CATCH: A Controllable Analysis Testbed for Reward Hacking in Coding RL

    Sep 30, 2026Shouli Wang, Yanfeng Jia, Zhihao Ou +6RL BenchmarksRL for Code Generation

  6. CAST: Causal Advantage-Structured Training with Spatially Grounded Compositional Rewards for Diffusion Models

    Sep 30, 2026Shu Yu, Chaochao LuDiffusion Model Fine-TuningCompositional T2I Generation

  7. Group-Marginalized Self-Rewarding RL Drives Zero-Label Self-Evolving

    Sep 29, 2026Yiming Wang, Yikang Liu, Qingyuan Tian +4RL for Language ModelsReinforcement Learning

  8. Verifier Errors in RLVR: Reward Hacking, Limits of Feedback, and Selective Control

    Sep 28, 2026Christian Moya, Elliott Thornley, Guang LinReward HackingReinforcement Learning

  9. Rubric Rewards from Item Response Theory

    Sep 28, 2026Milad Yazdani, Yaser Souri, Xiren Zhou +4Reward ModelingRubric-Based RL

  10. Sufficiency of Zeroth-Order Reward Shaping for Policy Gradient in Stabilization Control

    Sep 28, 2026Yisheng Zhang, Tao Wang, Sicun GaoReward ShapingRobotic RL

  11. CRISP: Cultural Reward Modeling for Implicit Situated Propriety

    Sep 28, 2026Zekun Yuan, Yangfan Ye, Baohang Li +6Reward ModelingRL for Language Models

  12. Evolving Support Priorities in Empathetic Reinforcement Learning

    Sep 28, 2026Pengyu Huang, Zhiyuan Han, Wenwen Tong +6Reward ModelingRL for Language Models

  13. Demonstration-Free Success-Probability Reward Learning for Generalist Robot Policies

    Sep 27, 2026Duo Wu, Haifeng Wang, Rongwei Lu +6Robotic RLSparse-Reward RL

  14. Reinforcement Learning with Verifiable Rewards for Small Search Agents

    Sep 23, 2026Gaurisankar Jayadas, Aske Plaat, Álvaro Serra-Gómez +1Reinforcement LearningReinforcement Learning with Verifiable Rewards

  15. DCRL: Decoupling and Coupling Reinforcement Learning via Policy-Reward Manifold Alignment

    Sep 23, 2026Henan Sun, Zehua Li, Haitao Hu +4Reinforcement LearningRL for Language Model Reasoning

  16. Sometimes You Gotta Run Before You Can Walk: Run-then-Walk Scheduling Strategy for VLM Autonomous Driving

    Sep 22, 2026Yuqi Ye, Shangkun Sun, Junhong Lin +6VLMs for Autonomous DrivingGroup Relative Policy Optimization

  17. RLVR2^{2}: Reinforcement Learning with Verifiable Rubric-based Ranking

    Sep 20, 2026Hao Li, Zhengkun Zhang, Gangqiang Hu +4Learning to RankRubric-Based RL

  18. Mitigating Retaliatory Algorithmic Collusion in Repeated Games

    Sep 17, 2026Karthik Sivachandran, Rohan PalejaGame-Playing AgentsRepeated Games

  19. Flow-Matched Motion Priors: Online Optimal-Transport Rewards for Imitation Learning

    Sep 14, 2026Yilin Zou, Chenghua Liu, Chenglong Wu +1Imitation LearningRL for Legged Locomotion

  20. Specifying Reward Functions for RL Without Environment Sampling

    Sep 14, 2026Stephane Hatgis-Kessell, W. Bradley Knox, Emma BrunskillLLM-Guided RLReward Design for RL

  21. EvoRS: On-Policy Self-Evolution of Reward Systems for Open-Ended Reinforcement Learning

    Sep 14, 2026Weiyuan Li, Aili Chen, Xintao Wang +11Reward HackingReinforcement Learning

  22. From Connectivity to Rewards: Dense Reward Learning with Directed State Graphs

    Sep 11, 2026Shuyuan Zhang, Zihan Wang, Xiao-Wen Chang +1Reinforcement LearningHierarchical RL

  23. Spurious Advantage Hidden in GRPO

    Sep 3, 2026Jiamian Wang, Samyadeep Basu, Koustava Goswami +2Reinforcement LearningGroup Relative Policy Optimization

  24. GDB-Reward: From Evaluation Metrics to Training Rewards for Graphic Design

    Sep 2, 2026Adrienne Deganutti, Purvanshi Mehta, Simon Hadfield +1Reward Design for RLPrompt Optimization for T2I Generation

  25. Dense Process Supervision for Search Agents via Fact Utility Estimation

    Sep 1, 2026Rongzhi Zhu, Xiangyu Liu, Yi Liu +7Reinforcement LearningCredit Assignment in RL

  26. What Emerges and What Breaks in Self-Play Driving

    Aug 31, 2026Laur Sisask, Ardi Tampuu, Tambet MatiisenReward HackingSelf-Play RL

  27. Locally-Guided Actor-Critic: Training a Goal-conditioned Actor with a Subgoal-aware Critic

    Aug 31, 2026Olivier Serris, Stéphane Doncieux, Olivier SigaudReinforcement LearningSparse-Reward RL

  28. Beyond Uncertainty: Multi-Solver Disagreement Rewards for Self-Evolving Reasoning Curricula

    Aug 30, 2026Vinoth Selvendran, Zhanming ZhangReward ModelingRL for Language Model Reasoning

  29. Towards Socially Compliant Navigation in Deep Reinforcement Learning via Proxemics-Based Reward Modeling

    Aug 13, 2026Takieddine Soualhi, Jacques Saraydaryan, Laetitia MatignonRL for RoboticsSocial Robot Navigation

  30. Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL

    Aug 12, 2026Minglai Yang, Xinyu Guo, Utkarsh Tyagi +6Reward HackingRubric-Based RL

  31. CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning

    Aug 10, 2026Ambuj Mehrish, Sebastiano VasconReward ModelingRL for Language Models

  32. RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning

    Aug 10, 2026Jinkun Hou, Zhuo Liu, Huimin Ren +3Open-Ended GenerationRL for Language Models

  33. Multi-Agent Reinforcement Learning via Agent-Specific Preference

    Aug 9, 2026Ni Mu, Yao Luan, Yiqin Yang +1Decentralized MARLCooperative MARL

  34. A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning

    Aug 8, 2026Fouad BahrpeymaReward ShapingReward Design for RL

  35. RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction

    Aug 6, 2026Chenglong Wang, Ziming Zhu, Yifu Huo +9Reward ModelingRL for Language Models

  36. Training a Conditioned Video Game Agent on a VLM Annotated Dataset

    Aug 6, 2026Katrin Schmid, Iuri FrosioReinforcement LearningReward Design for RL

  37. Reward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement Learning

    Aug 5, 2026Jai Malegaonkar, Rohan Patil, Henrik I. ChristensenReinforcement LearningPartially Observable RL

  38. GORDON: Graph-based Object-centric Rewards for Decomposition of Long-Horizon Manipulation

    Aug 4, 2026Andrea Protopapa, Davide Buoso, Francesca Pistilli +2Long-Horizon Robotic ManipulationLearning from Demonstration

  39. DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards

    Aug 1, 2026Yunhao Wang, Binghong Wu, Zhenyu Huang +4Reward ShapingDocument Parsing

  40. LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback

    Jul 31, 2026Manith Adikari, Bei Peng, Samuele Vinanzi +1Multi-Objective Reinforcement LearningReinforcement Learning

  41. Beyond Binary Rewards: A Comparative Study of Reward Design for Reinforcement Unlearning

    Jul 30, 2026Efstratios Zaradoukas, Davide Gabrielli, Bardh Prenkaj +1Reinforcement Learning with Verifiable RewardsMachine Unlearning

  42. Reinforcement Learning for Code Optimization

    Jul 28, 2026Pierre Chambon, Kunhao Zheng, Juliette Decugis +2RL for Code GenerationReinforcement Learning

  43. Optimal Reward Shaping: Autonomous Car Parking Case Study

    Jul 26, 2026Emre Özkaya, Nicolas R. GaugerDeep Q-LearningAutonomous Parking

  44. Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards

    Jul 24, 2026Cheng Ruoxi, Ma Haoxuan, Zhang Hongyi +7Retrieval-Augmented GenerationLLM Grounding

  45. Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation

    Jul 23, 2026Quazi Ishtiaque Mahmud, Nesreen K. Ahmed, Ali JannesariRL for Code GenerationGPU Kernel Optimization

  46. CriPO: Enhancing Rubric-based RL via Self-Distillation

    Jul 20, 2026Mingxuan Xia, Yuhang Yang, Chao Ye +7Credit Assignment in RLRubric-Based RL

  47. CORAL: Learning Amyloid Fibril Ligand Docking with Cooperative Binding Rewards

    Jul 19, 2026Yasheng Sun, Bohan Li, Youqi Tao +1Reward Design for RLDrug Discovery

  48. Principled Direction-Free Intrinsic Motivation through Model-Free Epistemic Free-Energy Estimators

    Jul 18, 2026Alireza Furutanpey, Schahram DustdarFree Energy CalculationIntrinsic Reward Methods

  49. CLaC@FinMMEval 2026 Task 3: Sentiment-Augmented Deep Reinforcement Learning for Active Trading -- An Alpha-Reward Approach

    Jul 17, 2026Andrei Neagu, Eeham Khan, Leila KosseimReinforcement LearningDeep Q-Learning