Reward Hacking

Momentum

20 papers in the last four weeks, up 100% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 112

All topics
CardsList
  1. Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL

    Aug 12, 2026Minglai Yang, Xinyu Guo, Utkarsh Tyagi +6Reward HackingRubric-Based RL

  2. How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review

    Aug 10, 2026Ming Li, Chenguang Wang, Xirui Li +5Reward HackingLLM Evaluation

  3. Evaluator Ensembles Under Reward Hacking: Covariance Geometry and Finite-Search Guarantees

    Aug 8, 2026Fariya Afrin, Ibne Farabi ShihabReward HackingLLM Evaluation

  4. HERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewards

    Aug 6, 2026Zhuowen Liu, Bohan Cui, YinShang Guo +2Reward HackingLLM Auditing

  5. Auditing Discovery Claims: A Two-Sided Criterion for Agentic Science, with the Negative Side Decidable

    Aug 2, 2026Wenhui Chen, Jianlin Chen, Ziyao Lin +1Reward HackingAI for Science

  6. Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI

    Jul 24, 2026Jiaqi Shao, Hanck Chen, Wei Zhang +2Computer-Use Agent BenchmarksReward Hacking

  7. Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data

    Jul 20, 2026Nursultan Askarbekuly, Mohamad Al Mdfaa, Ahmed Helaly +2AI Agent ReliabilityReward Hacking

  8. On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models

    Jul 5, 2026Chee Heng Tan, Zhuoyi Lin, Mehul Motani +1Reward HackingConfidence Estimation in Language Models

  9. Modification-Considering Value Learning for Reward Hacking Mitigation in RL

    Jun 27, 2026Evgenii Opryshko, Umangi Jain, Igor GilitschenskiReward HackingReinforcement Learning

  10. Designing Reward Signals for Portable Query Generation: A Case Study in Industrial Semantic Job Search

    Jun 25, 2026Ping Liu, Qianqi Shen, Jianqiang Shen +11Reward HackingReward Shaping

  11. The Verification Horizon: No Silver Bullet for Coding Agent Rewards

    Jun 24, 2026Binghai Wang, Chenlong Zhang, Dayiheng Liu +10Reward ModelingReward Hacking

  12. Reward as An Agent for Embodied World Models

    Jun 18, 2026Pu Li, Zhigang Lin, Qiang Wu +3Reward ModelingReward Hacking

  13. Uncertainty-Aware Reward Modeling for Stable RLHF

    Jun 18, 2026Licheng Pan, Haocheng Yang, Haoxuan Li +7Reward ModelingReward Hacking

  14. Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds

    Jun 13, 2026Ömer Veysel Çağatan, Xuandong ZhaoReward HackingLanguage Model Safety Evaluation

  15. Gradient-Guided Reward Optimization for Inference-time Alignment

    Jun 8, 2026Hankun Lin, Ruqi ZhangReward HackingLLM Alignment

  16. Hardening Agent Benchmarks with Adversarial Hacker-Fixer Loops

    Jun 8, 2026Ziqian Zhong, Ivgeni Segal, Ivan Bercovich +3Reward HackingAI Agent Security Benchmarks

  17. Cheap Reward Hacking Detection

    Jun 8, 2026Iván Belenky, Joaquín Itria, Steven JohnsReward HackingLanguage Model Auditing

  18. Do Coding Agents Deceive Us? Detecting and Preventing Cheating via Capped Evaluation with Randomized Tests

    Jun 5, 2026Thanawat Lodkaew, Johannes Ackermann, Soichiro Nishimori +3Reward HackingCoding Agents

  19. Reward hacking in physical reinforcement learning revealed by turbulent drag reduction

    Jun 4, 2026Giorgio Maria Cavallazzi, Miguel Pérez-Cuadrado, Alfredo PinelliRL ControlReward Hacking