Reward Hacking

Momentum

20 papers in the last four weeks, up 100% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 112

All topics
CardsList
  1. Distill-Belief: Closed-Loop Inverse Source Localization and Characterization in Physical Fields

    Apr 28, 2026Yiwei Shi, Zixing Song, Mengyue Yang +2Belief-Space PlanningReward Hacking

  2. Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Trainig-Time Reward Hacking in Code Generation

    Apr 26, 2026Lichen Li, Hengguang Zhou, Yijun Liang +2RL for Code GenerationReward Hacking

  3. Terminal Wrench: A Dataset of 331 Reward-Hackable Environments and 3,632 Exploit Trajectories

    Apr 19, 2026Ivan Bercovich, Ivgeni Segal, Kexun Zhang +3Reward HackingAI Agent Security Benchmarks

  4. Debate as Reward: A Multi-Agent Reward System for Scientific Ideation via RL Post-Training

    Apr 17, 2026Moein Salimi, Babak Hosseini Mohtasham, Amin Aghakasiri +6Reward HackingRL for Language Models

  5. Detecting and Suppressing Reward Hacking with Gradient Fingerprints

    Apr 17, 2026Songtao Wang, Quang Hieu Pham, Fangcong Yin +4Reward HackingReinforcement Learning with Verifiable Rewards

  6. LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking

    Apr 16, 2026Lukas Helff, Quentin Delfosse, David Steinmann +6Reward HackingLogical Reasoning

  7. Safety Training Modulates Harmful Misalignment Under On-Policy RL, But Direction Depends on Environment Design

    Apr 14, 2026Leon Eshuijs, Shihan Wang, Antske FokkensReward HackingRL for Language Models

  8. Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation

    Feb 10, 2026Pei-Chi Pan, Yingbin Liang, Sen LinReward ModelingReward Hacking

  9. Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking

    Feb 2, 2026Mohammad Beigi, Ming Jin, Junshan Zhang +2Adversarial TrainingReward Hacking

  10. Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs

    Jan 16, 2026Lecheng Yan, Ruizhe Li, Guanhua Chen +5Reward HackingMemorization in Language Models

  11. Understanding Reward Hacking in Text-to-Image Reinforcement Learning

    Jan 6, 2026Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou +1Reward HackingMultimodal Reward Modeling

  12. Training Language Models to Use Prolog as a Tool

    Dec 8, 2025Niklas Mellgren, Peter Schneider-Kamp, Lukas Galke PoechReward HackingLogical Reasoning

  13. Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation

    Nov 25, 2025Taehoon Kim, Henry Gouk, Timothy HospedalesDiffusion Model AlignmentReward Hacking

  14. Rethinking Reward Signals in Video GRPO: When Scores Become Targets

    Nov 24, 2025Rui Li, Yuanzhi Liang, Ziqi Ni +3Reward HackingRL for Video Generation

  15. Truthful or Fabricated? Using Causal Attribution to Mitigate Reward Hacking in Explanations

    Apr 7, 2025Pedro Ferreira, Wilker Aziz, Ivan TitovCoT FaithfulnessReward Hacking

  16. Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR

    Date pendingMuhammad Khalifa, Zohaib Khan, Omer Tafveez +2RL BenchmarksReward Hacking

  17. SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents

    Date pendingBingchen Zhao, Dhruv Srikanth, Yuxiang Wu +1Reward HackingAI Coding Agents

  18. A False Average: Pooled CoT-Monitor Accuracy Conceals a Reasoning-Dependent Fragility

    Date pendingShikhar Shiromani, Leo RichterReward HackingAdversarial Attacks on LLMs