Reward Design for RL

RL: Reinforcement Learning

Momentum

23 papers in the last four weeks, up 64% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 167

All topics
CardsList
  1. ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning

    Jun 23, 2026Wenyang Hu, Junxiang Jia, Zhen Shu +3RL for Language ModelsRL for Language Model Reasoning

  2. Causal Reward World Models: Zero-shot Reward Design for Automated Skill Generation

    Jun 22, 2026Yang Yang, Yuchuang Tong, Zhengtao Zhang +6RL for RoboticsRobot Skill Learning

  3. EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning

    Jun 22, 2026Hongxin Ding, Baixiang Huang, Yue Fang +6RL for Language ModelsRubric-Based RL

  4. RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation

    Jun 20, 2026Pengzhi Yang, Xinyu Wang, Pengyu Jing +7Long-Horizon Robotic ManipulationRobot Skill Learning

  5. A Reward-Petri-Net Interpretation of Temporal Behavior Trees

    Jun 19, 2026Till Schmeil, Günther Waxenegger-Wilfing, Sebastian SchirmerReinforcement LearningReward Shaping

  6. ARCO: Adaptive Rubric with Co-Evolution for Multi-Step LLM-Based Agents

    Jun 19, 2026Zihang Tian, Jingsen Zhang, Rui Li +3Process Reward ModelsCredit Assignment in RL

  7. Evolutionary Discovery of Developmental Reward Schedules in Deep Reinforcement Learning

    Jun 18, 2026Alan Nadelsticher RuvalcabaReinforcement LearningSparse-Reward RL

  8. ExpRL: Exploratory RL for LLM Mid-Training

    Jun 15, 2026Violet Xiang, Amrith Setlur, Chase Blagden +2Reinforcement LearningRL for Language Model Reasoning

  9. Evolutionary Bilevel Reward Shaping for Generalization in Reinforcement Learning

    Jun 15, 2026Ekasit Usaratniwart, Xilin Gao, Marc Ong +1Reinforcement LearningReward Shaping

  10. ReCal: Reward Calibration for RL-based LLM Routing

    Jun 10, 2026Qihang Yu, Hanwen Tong, Zhengqi Zhang +5Multi-Objective Reinforcement LearningRL for Language Models

  11. SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation

    Jun 9, 2026Qianzhong Chen, Hau Zheng, Justin Yu +8RL for RoboticsReward Modeling

  12. Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short

    Jun 8, 2026Han Zhou, Adam X. Yang, Laurence Aitchison +2Pairwise Preference LearningReward Modeling

  13. ComplexConstraints and Beyond: Expert Rubrics for RLVR

    Jun 8, 2026Sushant Mehta, Liudas Panavas, Suhaas Garre +1LLM-as-a-JudgeRubric-Based RL

  14. Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions

    Jun 8, 2026Xin Jin, Huanqia Cai, Zhen Li +9Reward ModelingReasoning Distillation

  15. Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization

    Jun 7, 2026Hao Chen, Zhanming Shen, Liyao Li +8Intrinsic Reward MethodsReinforcement Learning

  16. Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models

    Jun 7, 2026Yawen Shao, Jie Xiao, Kai Zhu +6RL for Language Model ReasoningCredit Assignment in RL

  17. RREDCoT: Segment-Level Reward Redistribution for Reasoning Models

    Jun 4, 2026Mykyta Ielanskyi, Kajetan Schweighofer, Lukas Aichberger +1Reinforcement LearningRL for Language Model Reasoning

  18. Reward hacking in physical reinforcement learning revealed by turbulent drag reduction

    Jun 4, 2026Giorgio Maria Cavallazzi, Miguel Pérez-Cuadrado, Alfredo PinelliRL ControlReward Hacking

  19. QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards

    Jun 2, 2026Rongzhi Zhang, Rui Feng, Zhihan Zhang +8Reinforcement LearningRL for Language Model Reasoning

  20. Mitigating False Credit Propagation: Probabilistic Graphical Reward Aggregation for Rubric-Based Reinforcement Learning

    Jun 2, 2026Can Lv, Mingju Chen, Heng Chang +1Reward ModelingRL for Language Models

  21. Reinforcement Learning from Cross-domain Videos with Video Prediction Model

    Jun 2, 2026Zhao Yang, Xinrui Zu, Jacob E. Kooi +5RL for RoboticsImitation Learning

  22. RDA: Reward Design Agent for Reinforcement Learning

    Jun 1, 2026Hojoon Lee, Ajay Subramanian, Ben Abbatematteo +4Agentic RLReinforcement Learning

  23. Deep Research as Rubric for Reinforcement Learning

    May 31, 2026Wangyi Mei, Zhouhong Gu, Zhenhan Bai +9Open-Ended GenerationReinforcement Learning

  24. Safe Equilibrium Policy Optimization for Strategic Agent Policies

    May 29, 2026Karthika Arumugam, Kiran Kumar Manku, Amit DhandaMulti-Agent System OptimizationGame-Playing Agents

  25. LLM-ALSO: LLM-Driven Adaptive Learning-Signal Optimization for Multi-Agent Reinforcement Learning

    May 28, 2026Xiaoguang Wu, Zhi Zheng, Hui XiongReward ShapingLLM-Guided RL

  26. Prompt-Level Reward Specifications for Open-Ended Post-Training

    May 28, 2026Zijun Weng, Xiaohui Hu, Shuangyong Song +3Open-Ended GenerationReward Modeling

  27. Label-Free Reinforcement Learning via Cross-Model Entropy

    May 27, 2026Matt Gorbett, Hossein ShiraziReinforcement LearningInstruction Following