Reward Design for RL

RL: Reinforcement Learning

Momentum

23 papers in the last four weeks, up 64% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 167

All topics
CardsList
  1. Retrieval, Reward, and Training Protocols: What Matters in Training Search Agents?

    May 27, 2026Yibo Zhao, Zichen Ding, Jiayi Wu +2LLM AgentsInformation Retrieval

  2. Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation

    May 26, 2026Zixuan Yang, Yiqun Chen, Wei Yang +7Open-Ended GenerationReward Modeling

  3. Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards

    May 26, 2026Yu Huang, Zihua Zhao, Zhaoxin Huan +9Multi-Objective Reinforcement LearningRL for Language Models

  4. RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents

    May 25, 2026Mingchen Li, Hansi Zeng, Zhuo Qian +3RL for Language Model ReasoningCredit Assignment in RL

  5. The Behavioral Credibility Trilemma: When Calibrated Autonomy Becomes Impossible

    May 25, 2026Lauri Lovén, Nam Do, Hassan Mehmood +2AI Agent ReliabilityAI Agent Governance

  6. From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models

    May 22, 2026Christian Gumbsch, Leonardo Barcellona, Lennard Schünemann +7RL for RoboticsMultimodal Reward Modeling

  7. ARMS: Automatic Reward Shaping for Sparse-Reward Multi-Agent Reinforcement Learning

    May 22, 2026Elie Abboud, Oren GalMulti-Agent System OptimizationSparse-Reward RL

  8. ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning

    May 22, 2026Xiaoyuan Li, Keqin Bao, Moxin Li +5RL for Language ModelsReinforcement Learning

  9. From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning

    May 22, 2026Ranxu zhang, zeyang li, Jiacheng Huang +5Agentic RLReinforcement Learning

  10. Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework

    May 21, 2026Shourov Joarder, Diganta Sikdar, Ahsan Habib Akash +2Multi-Objective Reinforcement LearningIntrinsic Reward Methods

  11. CIG: Exploration via Conditional Information Gain

    May 20, 2026Tim Joseph, Marcus Fechner, Philipp Stegmaier +2Intrinsic Reward MethodsIntrinsic Motivation

  12. Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR

    May 19, 2026Utkarsh Tyagi, Xingang Guo, MohammadHossein Rezaei +5Reward ModelingRubric-Based RL

  13. ARC-RL: A Reinforcement Learning Playground Inspired by ARC Raiders

    May 19, 2026Carlo Romeo, Andrew D. BagdanovRL BenchmarksRobotics Simulation

  14. AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning

    May 18, 2026Peilin Wu, Xinlu Zhang, Kun Wan +4RL for Language ModelsReinforcement Learning

  15. Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation

    May 18, 2026Guining Cao, Jiaxin Peng, Chu Zeng +3Pairwise Preference LearningOpen-Ended Generation

  16. Step-wise Rubric Rewards for LLM Reasoning

    May 17, 2026Weichu Xie, Haozhe Zhao, Wenpu Liu +15Reward ModelingCredit Assignment in RL

  17. ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization

    May 12, 2026Nirmal Patel, Fei Wang, Inderjit S. DhillonRL for Language ModelsReinforcement Learning

  18. Reward Hacking in Rubric-Based Reinforcement Learning

    May 12, 2026Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang +3Reward HackingReinforcement Learning

  19. EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models

    May 12, 2026Zhikai Zhao, Chuanbo Hua, Federico Berto +4Evolutionary OptimizationRobot Navigation

  20. GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation

    May 12, 2026Sijia Li, Yuchen Huang, Zifan Liu +7RL for Language Model ReasoningCredit Assignment in RL

  21. Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning

    May 8, 2026Manish Bhattarai, Ismael Boureima, Nishath Rajiv Ranasinghe +2Reinforcement LearningRL for Language Model Reasoning

  22. ExpThink: Experience-Guided Reinforcement Learning for Adaptive Chain-of-Thought Compression

    May 8, 2026Tingcheng Bian, Yuzhe Zhang, Jing Jin +5Reward ShapingRL for Language Model Reasoning

  23. MARBLE: Multi-Aspect Reward Balance for Diffusion RL

    May 7, 2026Canyu Zhao, Hao Chen, Yunze Tong +3Multi-Objective Reinforcement LearningDiffusion Model Alignment

  24. Reward Shaping and Action Masking for Compositional Tasks using Behavior Trees and LLMs

    May 7, 2026Nicholas Potteiger, Ankita Samaddar, Taylor T. Johnson +1Reinforcement LearningReward Shaping

  25. Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards

    May 5, 2026Tianyang Han, Hengyu Shi, Junjie Hu +3RL for Code GenerationProcess Reward Models