20 papers in the last four weeks, up 100% on the four weeks before. 0.2% of all new papers.
Oct 6, 2026·Param Biyani, Krishnamurthy DvijothamAI Agent SafetySoftware Engineering Agents
MATS · Google DeepMind
Oct 5, 2026·Subramanyam Sahoo, Justin ShenkReward HackingLLM Auditing
Horizon Research.
Oct 4, 2026·Haocheng Yang, Yuchao Zhang, Licheng Pan +8Reward HackingRubric-Based RL
National University of Singapore · Beijing University of Chemical Technology · Zhejiang University +7
Sep 30, 2026·Shouli Wang, Yanfeng Jia, Zhihao Ou +6RL BenchmarksRL for Code Generation
Tsinghua University · Beihang University · Southern University of Science and Technology +2
Sep 30, 2026·Tsubasa Ochiai, Marc Delcroix, Nahomi Kusunoki +5Reward HackingTest-Time Optimization
NTT, Inc., Japan · Waseda University, Japan
Sep 30, 2026·Maoqi Liu, Junwei He, Bowen Zhang +5Reward HackingRubric-Based RL
Beijing University of Posts and Telecommunications · ByteDance
Sep 29, 2026·Wan Tian, Zhongyi Li, Xiang Xu +3Reward HackingGroup Relative Policy Optimization
Peking University · Beihang University · Nanjing University
Sep 28, 2026·Long Phan, Stephen K. Yang, Jason J. Lim +10Reward HackingAI Agent Benchmarks
Center for AI Safety · Work done while at the Center for AI Safety.
Sep 28, 2026·Zhaolong Su, Yujin Han, Feng Wang +3Diffusion Model AlignmentReward Modeling
Cornell University · The University of Hong Kong · Johns Hopkins University
Sep 28, 2026·Christian Moya, Elliott Thornley, Guang LinReward HackingReinforcement Learning
Purdue University · National University of Singapore
Sep 28, 2026·Morui Zhu, Deyuan Qu, Qi Chen +2Autonomous Driving BenchmarksReward Hacking
University of North Texas · Toyota InfoTech Labs
Sep 28, 2026·Weijun Luo, Kelvin Luu, Xinyi Liu +6Reward HackingBenchmark Auditing
Scale AI
Sep 23, 2026·Yue Huang, Zhangchen Xu, Yuchen Ma +12Reward HackingAI Agent Auditing
Bake AI · University of Notre Dame · University of Washington +6
Sep 22, 2026·Vansh WahiReward HackingLLM Evaluation
Sep 16, 2026·Leon Bergen, Usha Bhalla, Andrew Lee +15Reward HackingLLM Evaluation
Core contributors · Equal senior contribution
Sep 15, 2026·Bowen Qin, Yi Xie, Yesheng Liu +1Reward HackingLanguage Model Generation Evaluation
National University of Singapore · Peking University · Institute of Automation, Chinese Academy of Sciences
Sep 14, 2026·Arun Jose, Julian StastnyReward HackingFine-Tuning
Astra Fellowship · Redwood Research
Sep 14, 2026·Weiyuan Li, Aili Chen, Xintao Wang +11Reward HackingReinforcement Learning
School of Data Science, Fudan University · Shanghai Key Laboratory of Data Science · College of Computer Science and Artificial Intelligence, Fudan University +3
Sep 12, 2026·Shenghan Zheng, Zonglin Di, Yimin Liu +19Reward HackingLLM Agent Evaluation
Dartmouth College · Independent · Ohio State University +10
Sep 9, 2026·Eshwar Reddy M, Sourav KarmakarReward ModelingReward Hacking
AI Engineer, Testsigma University of San Diego · Senior AI Scientist, Intuit India
Sep 8, 2026·Pujun Zheng, Zixin Shang, Shufan Jiang +5Reward HackingSoftware Engineering Agents
East China Normal University · Shanghai Artificial Intelligence Laboratory · Fudan University
Sep 7, 2026·Rongxin Yang, Yang Liu, Shang Luo +10Reward HackingLanguage Model Self-Improvement
1Fullive-AI · 2Peking University · 4Nanyang Technological University +2
Sep 2, 2026·Vansh WahiLLM-as-a-JudgeSelf-Improving Agents
AI Research Engineer
Sep 1, 2026·Siyuan Li, Xinxin Song, Chen Ruinian +5Reward HackingRubric-Based RL
Department of Automation, Tsinghua University · Meituan
Aug 31, 2026·Yu Yuan, Yaoyou Fan, Lili Zhao +5Multi-Objective Reinforcement LearningReward Hacking
University of Science and Technology of China · 2State Key Laboratory of Cognitive Intelligence · 3Peking University +1
Aug 31, 2026·Laur Sisask, Ardi Tampuu, Tambet MatiisenReward HackingSelf-Play RL
University of Tartu, Tartu, Estonia
Aug 31, 2026·Pradyumna Shyama Prasad, Meiri Anto, Leon Eshuijs +3Reward HackingAI Agent Evaluation
National University of Singapore · MIT · Vrije Universiteit Amsterdam +3
Aug 31, 2026·Bowei He, Weixu Zhang, Yili Jin +1Reward HackingAutomated Algorithm Discovery
MBZUAI · McGill University · MirrorSpace Technology +1
Aug 30, 2026·Shiliang XiaoReward HackingLLM Jailbreak Attacks
Aug 29, 2026·Francesca GomezReward HackingCoding Agents
Wiser Human