Reward Hacking

Momentum

20 papers in the last four weeks, up 100% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 112

All topics
CardsList
  1. From Reward-Hack Activations to Agentic Risk States: Context-Calibrated Mechanistic Monitoring in LLM Agents

    Jun 4, 2026Patrick Wilhelm, Odej KaoReward HackingAI Agent Safety

  2. Self-Commitment Latency: A Reward-Free Probe for Prompted Implicit Hacking

    Jun 4, 2026Bonan Shen, Youting Wang, Dingyan Shang +1Reward HackingLanguage Model Probing

  3. Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning

    Jun 3, 2026Xuekang Wang, Zhuoyuan Hao, Shuo Hou +3Reward HackingRL for Language Models

  4. Large Language Models Hack Rewards, and Society

    Jun 2, 2026Wei Liu, Xinyi Mou, Hanqi Yan +2Reward HackingRL for Language Models

  5. When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming

    Jun 2, 2026Zelalem Abahana, David Evans, Satish Mahadevan Srinivasan +1Reward HackingLLM Evaluation

  6. Follow-Your-Preference++: Rethinking Preference Alignment for Image Inpainting

    Jun 2, 2026Junkun Yuan, Yutao Shen, Toru Aonishi +2Pairwise Preference LearningReward Modeling

  7. HARVE: Hacking-Aware Reward-Head Vector Editing for Robust Reward Models

    Jun 2, 2026Shuang Liu, Yuxuan Bo, Qiuyang Zhao +4Reward ModelingReward Hacking

  8. Hide to Guide: Learning via Semantic Masking

    May 24, 2026Ruitao Liu, Qinghao Hu, Alex Hu +6Reward HackingRL for Language Model Reasoning

  9. Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models

    May 24, 2026Wenlong Deng, Jiaji Huang, Kaan Ozkara +4Reward HackingRL for Language Models

  10. Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale

    May 20, 2026Amit Roth, Ankur Samanta, Matan Halevy +2Reward HackingAI Agent Benchmarks

  11. Imperfect World Models are Exploitable

    May 15, 2026Logan Mondal Bhamidipaty, Esmeralda S. Whitammer, David Abel +2Reward HackingWorld Model-Based Planning

  12. Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment

    May 13, 2026Ye Wang, Jing Liu, Toshiaki Koike-AkinoReward HackingLLM Alignment

  13. Pareto-Guided Optimal Transport for Multi-Reward Alignment

    May 13, 2026Ying Ba, Tianyu Zhang, Mohan Zhou +5Diffusion Model AlignmentReward Hacking

  14. Reward Hacking in Rubric-Based Reinforcement Learning

    May 12, 2026Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang +3Reward HackingReinforcement Learning

  15. Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping

    May 11, 2026Haoyuan Sun, Jing Wang, Yuxin Song +9Reward HackingPreference Optimization

  16. Test-Time Personalization: A Diagnostic Framework and Probabilistic Fix for Scaling Failures

    May 9, 2026Linhai Zhang, Yulan HeReward ModelingReward Hacking

  17. TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment

    May 9, 2026Jiaming Li, Chenyu Zhu, Nanxi Yi +9Diffusion Model AlignmentReward Hacking

  18. Theoretical Limits of Language Model Alignment

    May 8, 2026Lucas Monteiro Paes, Natalie Mackraz, Barry-John Theobald +1Reward HackingLLM Alignment

  19. Explaining and Preventing Alignment Collapse in Iterative RLHF

    May 5, 2026Etienne Gauthier, Francis Bach, Michael I. JordanReward HackingPolicy Gradient

  20. Towards Understanding Specification Gaming in Reasoning Models

    May 4, 2026Kei Nishimura-Gasparian, Robert McCarthy, David LindnerReward HackingRL for Language Model Reasoning