Reward Model Evaluation

Momentum

2 papers in the last four weeks, with none the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 22

All topics
CardsList
  1. F2^{2}DR: A Fine-Grained Full-Pipeline Reward Framework for DeepSearch Workflows

    Sep 17, 2026Bojian Xiong, Wentao Ding, Yujing Lu +11Reward ModelingLLM Evaluation

  2. Evaluator Ensembles Under Reward Hacking: Covariance Geometry and Finite-Search Guarantees

    Aug 8, 2026Fariya Afrin, Ibne Farabi ShihabReward HackingLLM Evaluation

  3. OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

    Jul 30, 2026Qiushi Sun, Kanzhi Cheng, Yian Wang +20VLM EvaluationComputer-Use Agent Benchmarks

  4. SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

    Jul 25, 2026Yang Wan, Zhenhao Zhang, Jierui Wang +1Reward ModelingLLM-as-a-Judge

  5. Discretizing Reward Models

    Jun 19, 2026Vijay Viswanathan, Shiqi Wang, Devamanyu Hazarika +4Reward ModelingReinforcement Learning

  6. Beyond Rubrics: Exploration-Guided Evaluation Skills for Reward Modeling

    Jun 5, 2026Xing Yue, Linjuan Wu, Daoxin Zhang +2Reward ModelingLLM Evaluation

  7. Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill

    Jun 2, 2026Tao Chen, Gangwei Jiang, Pengyu Cheng +10Reward ModelingReward Model Evaluation

  8. When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming

    Jun 2, 2026Zelalem Abahana, David Evans, Satish Mahadevan Srinivasan +1Reward HackingLLM Evaluation

  9. HARVE: Hacking-Aware Reward-Head Vector Editing for Robust Reward Models

    Jun 2, 2026Shuang Liu, Yuxuan Bo, Qiuyang Zhao +4Reward ModelingReward Hacking

  10. Position: Good Embodied Reward Models Need Bad Behavior Data

    May 31, 2026Ran Tian, Yilin Wu, Andrea BajcsyReward ModelingPreference Alignment

  11. EST-PRM: Stress-Testing Process Reward Models Before They Become Load-Bearing

    May 30, 2026Ibne Farabi Shihab, Fariya Afrin, Sanjeda Akter +1Process Reward ModelsLanguage Model Calibration

  12. FormalRewardBench: A Benchmark for Formal Theorem Proving Reward Models

    May 11, 2026Zeynel A. Uluşan, Burak S. Akbudak, Can S. Erer +1Reward ModelingAutomated Theorem Proving

  13. Misaligned by Reward: Socially Undesirable Preferences in LLMs

    May 6, 2026Gayane Ghazaryan, Esra DönmezReward ModelingLanguage Model Safety Evaluation

  14. StoryAlign: Evaluating and Training Reward Models for Story Generation

    May 6, 2026Haotian Xia, Hao Peng, Yunjia Qi +4Reward ModelingLanguage Model Generation Evaluation

  15. RMGAP: Benchmarking the Generalization of Reward Models across Diverse Preferences

    May 3, 2026Yangyang Zhou, Yi-Chen LiReward ModelingLLM Evaluation

  16. Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring

    May 1, 2026Indraneil Paul, Goran Glavaš, Iryna GurevychReward ModelingReward Model Evaluation

  17. From Coarse to Fine: Benchmarking and Reward Modeling for Writing-Centric Generation Tasks

    Apr 30, 2026Qingyu Ren, Tianjun Pan, Xingzhou Chen +1Reward ModelingRL for Language Models

  18. When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient

    Apr 28, 2026Shuning Shang, Hubert Strauss, Stanley Wei +2Reward ModelingPolicy Gradient

  19. Rethinking Reward Models for Multi-Domain Test-Time Scaling

    Oct 1, 2025Dong Bok Lee, Seanie Lee, Sangwoo Park +12Reward ModelingLLM Evaluation