Reward Hacking

Momentum

20 papers in the last four weeks, up 100% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 112

All topics
CardsList
  1. SpecGuard: Proving a Task Is Broken Before the Agent Cheats

    Oct 6, 2026Param Biyani, Krishnamurthy DvijothamAI Agent SafetySoftware Engineering Agents

  2. RubricArmor: Adversarial Evolution Improves LLM-Based Rubric Generation

    Oct 4, 2026Haocheng Yang, Yuchao Zhang, Licheng Pan +8Reward HackingRubric-Based RL

  3. CATCH: A Controllable Analysis Testbed for Reward Hacking in Coding RL

    Sep 30, 2026Shouli Wang, Yanfeng Jia, Zhihao Ou +6RL BenchmarksRL for Code Generation

  4. Improving Predicted MOS Scores, Not Perceived Quality: Multi-Predictor Test-Time Optimization of Enhanced Speech

    Sep 30, 2026Tsubasa Ochiai, Marc Delcroix, Nahomi Kusunoki +5Reward HackingTest-Time Optimization

  5. Scoring Higher, Answering Worse: Mitigating Reward Hacking in Rubric-Based RL via Protocol-Level Rubrics

    Sep 30, 2026Maoqi Liu, Junwei He, Bowen Zhang +5Reward HackingRubric-Based RL

  6. STAR-GRPO: Canonical Anchoring and Reliability-First Advantages against Representation-Dependent Reward Hacking

    Sep 29, 2026Wan Tian, Zhongyi Li, Xiang Xu +3Reward HackingGroup Relative Policy Optimization

  7. CheatBench: Measuring Reward Gaming in AI Agents

    Sep 28, 2026Long Phan, Stephen K. Yang, Jason J. Lim +10Reward HackingAI Agent Benchmarks

  8. CoRe: Co-Evolving Reward Models for Mitigating Latent Reward Hacking in Video Diffusion Models

    Sep 28, 2026Zhaolong Su, Yujin Han, Feng Wang +3Diffusion Model AlignmentReward Modeling

  9. Verifier Errors in RLVR: Reward Hacking, Limits of Feedback, and Selective Control

    Sep 28, 2026Christian Moya, Elliott Thornley, Guang LinReward HackingReinforcement Learning

  10. When the Score Becomes the Target: Rethinking Metric Validity in Autonomous Driving

    Sep 28, 2026Morui Zhu, Deyuan Qu, Qi Chen +2Autonomous Driving BenchmarksReward Hacking

  11. Reward Hacking Challenges Oversight of Autonomous Research Agents

    Sep 23, 2026Yue Huang, Zhangchen Xu, Yuchen Ma +12Reward HackingAI Agent Auditing

  12. Monitoring and Discovering Reward Hacking with Internal Representations during LLM Evaluations

    Sep 16, 2026Leon Bergen, Usha Bhalla, Andrew Lee +15Reward HackingLLM Evaluation

  13. ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals

    Sep 15, 2026Bowen Qin, Yi Xie, Yesheng Liu +1Reward HackingLanguage Model Generation Evaluation

  14. EvoRS: On-Policy Self-Evolution of Reward Systems for Open-Ended Reinforcement Learning

    Sep 14, 2026Weiyuan Li, Aili Chen, Xintao Wang +11Reward HackingReinforcement Learning

  15. BenchShield: Formal Model-Backed Instrumentation for Reward Integrity in LLM-Agent Evaluation Infrastructure

    Sep 12, 2026Shenghan Zheng, Zonglin Di, Yimin Liu +19Reward HackingLLM Agent Evaluation

  16. Proof-Carrying Cognition: Closing the Verification Gap with Reality-Settled Reward

    Sep 9, 2026Eshwar Reddy M, Sourav KarmakarReward ModelingReward Hacking

  17. SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents

    Sep 8, 2026Pujun Zheng, Zixin Shang, Shufan Jiang +5Reward HackingSoftware Engineering Agents

  18. Harness-agnostic detection and immunization of reward hacking in self-evolving language models

    Sep 7, 2026Rongxin Yang, Yang Liu, Shang Luo +10Reward HackingLanguage Model Self-Improvement

  19. CARE: Contrastive Anchor-based Rubric Evolution for Large Language Model Post-Training

    Sep 1, 2026Siyuan Li, Xinxin Song, Chen Ruinian +5Reward HackingRubric-Based RL

  20. Uncovering and Mitigating Aggregation-Induced Reward Hacking in Multi-Reward Reinforcement Learning

    Aug 31, 2026Yu Yuan, Yaoyou Fan, Lili Zhao +5Multi-Objective Reinforcement LearningReward Hacking

  21. What Emerges and What Breaks in Self-Play Driving

    Aug 31, 2026Laur Sisask, Ardi Tampuu, Tambet MatiisenReward HackingSelf-Play RL

  22. BAITBENCH: Measuring Agent Reward Hacking with Optional Shortcuts Planted in ML Tasks

    Aug 31, 2026Pradyumna Shyama Prasad, Meiri Anto, Leon Eshuijs +3Reward HackingAI Agent Evaluation

  23. Beneath the Diff: Diagnosing and Mitigating Algorithmic Mode Collapse in Code-Level Autonomous Research Loops

    Aug 31, 2026Bowei He, Weixu Zhang, Yili Jin +1Reward HackingAutomated Algorithm Discovery