Reward Modeling

Momentum

24 papers in the last four weeks, up 118% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 197

All topics
CardsList
  1. SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation

    Jun 9, 2026Qianzhong Chen, Hau Zheng, Justin Yu +8RL for RoboticsReward Modeling

  2. Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short

    Jun 8, 2026Han Zhou, Adam X. Yang, Laurence Aitchison +2Pairwise Preference LearningReward Modeling

  3. Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions

    Jun 8, 2026Xin Jin, Huanqia Cai, Zhen Li +9Reward ModelingReasoning Distillation

  4. A Unifying Lens on Reward Uncertainty in RLHF

    Jun 8, 2026Ely Hahami, Yoel Zimmermann, Ray Zhou +1Reward ModelingKL-Regularized RL

  5. DynaCF: Mitigating Shortcut Learning in Reward Models via Dynamic Counterfactual Sensitivity

    Jun 8, 2026Fengyuan Liu, Yongliang Miao, Zirui He +3Pairwise Preference LearningReward Modeling

  6. Support Vector Rubrics: Closing the Gap Between Self-Generated and Human Rubrics

    Jun 6, 2026Mengyuan Sun, Yu Li, Zhuohao Yu +2Reward ModelingRubric-Based Evaluation

  7. PAFO: Pareto Fairness Optimization for Personalized Reward Modeling

    Jun 6, 2026Xiaoyan Zhao, Haoting Ni, Yang Zhang +3Reward ModelingLLM Alignment

  8. Beyond Rubrics: Exploration-Guided Evaluation Skills for Reward Modeling

    Jun 5, 2026Xing Yue, Linjuan Wu, Daoxin Zhang +2Reward ModelingLLM Evaluation

  9. Sparse Mixture-of-Experts Reward Models Learn Interpretable and Specialized Experts for Personalized Preference Modeling

    Jun 2, 2026Yifan Wang, Jinyi Mu, Mayank Jobanputra +5Pairwise Preference LearningReward Modeling

  10. Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill

    Jun 2, 2026Tao Chen, Gangwei Jiang, Pengyu Cheng +10Reward ModelingReward Model Evaluation

  11. Mitigating False Credit Propagation: Probabilistic Graphical Reward Aggregation for Rubric-Based Reinforcement Learning

    Jun 2, 2026Can Lv, Mingju Chen, Heng Chang +1Reward ModelingRL for Language Models

  12. ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents

    Jun 2, 2026Zheng Liu, Longxiang Zhang, Xintong Wang +8Reward ModelingProcess Reward Models

  13. Follow-Your-Preference++: Rethinking Preference Alignment for Image Inpainting

    Jun 2, 2026Junkun Yuan, Yutao Shen, Toru Aonishi +2Pairwise Preference LearningReward Modeling

  14. HARVE: Hacking-Aware Reward-Head Vector Editing for Robust Reward Models

    Jun 2, 2026Shuang Liu, Yuxuan Bo, Qiuyang Zhao +4Reward ModelingReward Hacking

  15. Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling

    Jun 1, 2026Seojeong Park, Jiho Choi, Junyong Kang +3Reward ModelingLLM-as-a-Judge

  16. Position: Good Embodied Reward Models Need Bad Behavior Data

    May 31, 2026Ran Tian, Yilin Wu, Andrea BajcsyReward ModelingPreference Alignment

  17. From Empathy to Personalized Empathy: Adapting Empathetic Strategies to Individual Users

    May 30, 2026Wuqiang Zheng, Chengbing Wang, Yilin Yang +6Reward ModelingLLM Personalization

  18. Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs

    May 30, 2026Jiakang Li, Guanyu Zhu, Can Jin +8Reward ModelingLanguage Model Steering

  19. CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts

    May 30, 2026Rui Zhang, Xinle Wu, Yao LuReward ModelingReinforcement Learning

  20. The Representation-Rationalizability Tradeoff in Reward Learning

    May 29, 2026Jing Dong, Yaoliang Yu, Pascal PourpartPairwise Preference LearningReward Modeling

  21. The Flip Side of RLHF: On-Policy Feedback for Reward Model Self-Supervised Improvement

    May 29, 2026Xiaobo Wang, Tong Wu, Min Tang +3Reward ModelingLLM Alignment

  22. Reward Learning from Best-of-NN Preference Data: Targets, Tradeoffs, and Design Principles

    May 28, 2026Rattana Pukdee, Maria-Florina Balcan, Pradeep RavikumarPairwise Preference LearningReward Modeling

  23. Configurable Reward Model for Balanced Safety Alignment

    May 28, 2026Zhengping Jiang, Mehran Khodabandeh, Akash Bharadwaj +5Reward ModelingLanguage Model Safety Evaluation

  24. Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling

    May 28, 2026Yuchen Liu, Yingjie Feng, Lixiong Qin +5Reward ModelingAgentic RL

  25. Prompt-Level Reward Specifications for Open-Ended Post-Training

    May 28, 2026Zijun Weng, Xiaohui Hu, Shuangyong Song +3Open-Ended GenerationReward Modeling

  26. RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains

    May 27, 2026Haoxiang Jiang, Zihan Dong, Tianci Liu +5Reward ModelingRL for Language Models

  27. Refining Multidimensional Video Reward Models via Disentangled Influence Functions

    May 27, 2026Muyao Wang, Zeke Xie, Hideki NakayamaReward ModelingTraining Data Selection

  28. StoryLens: Preference-Aligned Story Rewriting via Context-Aware Narrative Enrichment

    May 27, 2026Hanwen Cui, Yuting Mei, Yuhang Fu +2Reward ModelingPersonalized Text Generation