Reward Design for RL

RL: Reinforcement Learning

Momentum

23 papers in the last four weeks, up 64% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 167

All topics
CardsList
  1. Learning Safe Agent Behaviour from Human Preferences and Justifications via World Models

    Jul 14, 2026Ilias Kazantzidis, Timothy J. Norman, Yali Du +1Safe RLReward Design for RL

  2. SCOPE-RL: Optimizing Reasoning Paths Before and After Success

    Jul 13, 2026Xiaojian Liu, Han Xu, Jianqiang Xia +6Reward ShapingRL for Language Model Reasoning

  3. Calibration-First Reward-Component Auditing for Reinforcement Learning Control in Smart Greenhouses

    Jul 12, 2026Yuhui Bie, Guowei Xu, Yaojun WangRL ControlReinforcement Learning

  4. Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards

    Jul 11, 2026Pengfei Cai, Utkarsh Utkarsh, Alan Edelman +2RL for Code GenerationScientific Code Generation

  5. RLVP: Penalize the Path, Reward the Outcome

    Jul 8, 2026Bojie Li, Noah ShiAgentic RLConstrained RL

  6. A Gold-Standard Study of What Makes a Lightweight Game-Playing Agent Strong

    Jul 7, 2026Nima Kelidari, Mohammadsaeed Haghi, Mahdi SalmaniReinforcement LearningGame-Playing Agents

  7. Improving LLM-Generated Process Model Quality Through Reinforcement Learning: The Role of Reward Function Design

    Jul 7, 2026Alexander Rombach, Chantale Lauer, Nijat MehdiyevRL for Language ModelsMulti-Objective Language Model Alignment

  8. HiFuzz: Hierarchical Reinforcement Learning for Semantic-Aware and Adaptive CPU Fuzzing

    Jul 7, 2026Ya Wang, Hanwei Fan, Zhenguo Liu +4Hierarchical RLReward Design for RL

  9. On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models

    Jul 5, 2026Chee Heng Tan, Zhuoyi Lin, Mehul Motani +1Reward HackingConfidence Estimation in Language Models

  10. SPLC: Social Preference Learning for Crowd Robot Navigation

    Jul 2, 2026Zixuan Chen, Hao Fu, Haiwen Hu +1Robot NavigationSocial Robot Navigation

  11. Rank-Then-Act: Reward-Free Control from Frame-Order Progress

    Jul 2, 2026Yuriy Maksyuta, George Bredis, Ruslan Rakhimov +1RL ControlReward Modeling

  12. CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning

    Jul 2, 2026Hexian Ni, Tao Lu, Yinghao CaiRobotic RLMultimodal Reward Modeling

  13. Simulation Based Reward Function Validation for Multi-Agent On Orbit Inspection

    Jul 1, 2026Patrick Quinn, Bala Prenith Reddy Gopu, George M. Nehma +1Robotic InspectionCooperative MARL

  14. VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning

    Jul 1, 2026Kuan-Chen Chen, Winston Chen, Wei-Fang Sun +1Multimodal Reward ModelingReward Design for RL

  15. Learning Gait-Aware Quadruped Locomotion with Temporal Logic Specifications

    Jul 1, 2026Merve Atasever, Cagan Bakirci, Alfredo Reina Corona +2Reinforcement LearningRobot Skill Learning

  16. TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

    Jun 30, 2026Yuanda Xu, Zhengze Zhou, Hejian Sang +6Agentic RLStep-Level Credit Assignment in RL

  17. Stage-Transition Dense Reward Modeling for Reinforcement Learning

    Jun 30, 2026Yang Yang, Bingjie Chen, Zihan Wang +4RL for RoboticsLong-Horizon Robotic Manipulation

  18. A3M: Adaptive, Adversarial and Multi-Objective Learning for Strategic Bidding in Repeated Auctions

    Jun 27, 2026Junhan Li, Yuxin Zhang, Haoran Wang +1Multi-Objective Reinforcement LearningGame Theory

  19. WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation

    Jun 26, 2026Justin Yu, Andrew Goldberg, Kavish Kondap +7Long-Horizon Robotic ManipulationRobot Skill Learning

  20. Reinforcement Learning without Ground-Truth Solutions can Improve LLMs

    Jun 25, 2026Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang +6RL for Code GenerationReinforcement Learning

  21. Designing Reward Signals for Portable Query Generation: A Case Study in Industrial Semantic Job Search

    Jun 25, 2026Ping Liu, Qianqi Shen, Jianqiang Shen +11Reward HackingReward Shaping

  22. Automating Potential-based Reward Shaping with Vision Language Model Guidance

    Jun 25, 2026Henrik Müller, Daniel KudenkoReward ShapingSparse-Reward RL

  23. The Verification Horizon: No Silver Bullet for Coding Agent Rewards

    Jun 24, 2026Binghai Wang, Chenlong Zhang, Dayiheng Liu +10Reward ModelingReward Hacking

  24. MiniOpt: Reasoning to Model and Solve General Optimization Problems with Limited Resources

    Jun 24, 2026Ke Zhao, Zixiang Di, Hong Qian +9Large Language Model-Guided OptimizationRL for Language Model Reasoning

  25. MAPL: Multi-Objective Preference Learning for Robot Locomotion

    Jun 24, 2026Xiyue Chen, Muhan Lin, Shuyang Shi +1Multi-Objective Reinforcement LearningReward Modeling

  26. Reward-Conditioned Attention: How Reward Design Shapes What Autonomous Driving Agents See

    Jun 23, 2026Mohamed Benabdelouahad, Ahmed Djalal Hacini, Nadir Farhi +1Reward ShapingRL for Autonomous Driving