Also known as PRM
7 papers in the last four weeks, up 40% on the four weeks before. 0.1% of all new papers.
Jun 23, 2026·Jiachen QianProcess Reward ModelsGUI Agents
City University of Hong Kong
Jun 22, 2026·Raymond Tsao, Andrew Wagenmaker, Sergey LevineProcess Reward ModelsCredit Assignment in RL
UC Berkeley
Jun 20, 2026·Pengzhi Yang, Xinyu Wang, Pengyu Jing +7Long-Horizon Robotic ManipulationRobot Skill Learning
† NUS Human-Centered Robotic Lab · ‡ Booking.com · § University of Cambridge +1
Jun 19, 2026·Zihang Tian, Jingsen Zhang, Rui Li +3Process Reward ModelsCredit Assignment in RL
Renmin University of China
Jun 17, 2026·Amirul Rahman, Mohammed Sabih AlsharariPAC-Bayesian Generalization BoundsProcess Reward Models
University of Malaya
Jun 11, 2026·Rongxin Yang, Shenghong He, Siyuan Zhu +1Agentic RLProcess Reward Models
School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou 510006, China
Jun 8, 2026·Aakriti Agrawal, Souradip Chakraborty, Armin Saghafian +6Process Reward ModelsRL for Language Model Reasoning
University of Maryland, College Park · Capital One · University of Central Florida
Jun 5, 2026·Haocheng Lv, Huaping Zhang, Qiuchi Li +2Process Reward ModelsMultimodal Reasoning
Beijing Institute of Technology
Jun 5, 2026·Yudi Zhang, Meng Fang, Zhenfang Chen +1Reinforcement LearningProcess Reward Models
Eindhoven University of Technology, Netherlands · University of Liverpool, United Kingdom · MIT-IBM Watson AI Lab.
Jun 5, 2026·Yuhang Zhou, Yixin Cao, Guangnan YeProcess Reward ModelsRL for Language Model Reasoning
Fudan University · Shanghai Innovation Institute
Jun 5, 2026·Haojie Hao, Longkun Hao, Yihang Lou +8Reinforcement LearningRL for GUI Agents
Beihang University · Peking University · Renmin University of China +4
Jun 3, 2026·Xiangyu Zhao, Henry Hengyuan Zhao, Yiheng Wang +7Process Reward ModelsScientific Reasoning
The Hong Kong Polytechnic University · National University of Singapore · Shanghai AI Lab +3
Jun 2, 2026·Prashanth Vijayaraghavan, Apoorva Nitsure, Luyao Shi +2RL for Code GenerationProcess Reward Models
IBM Research San Jose, CA, USA
Jun 2, 2026·Lujie Ban, Jiasheng Shi, Jinyang Li +3Process Reward ModelsRL for Language Model Reasoning
The Chinese University of Hong Kong, Shenzhen · The University of Hong Kong · Northwestern Polytechnical University +1
Jun 2, 2026·Zheng Liu, Longxiang Zhang, Xintong Wang +8Reward ModelingProcess Reward Models
Tsinghua University · Alibaba Group · Peking University +1
Jun 2, 2026·Mingyang Liu, Qingcan Kang, Yuke Wang +6Process Reward ModelsFinancial Forecasting
Department of Computer Science, City University of Hong Kong · Work done as an intern in Huawei Noah’s Ark Lab. · Huawei Noah’s Ark Lab
May 31, 2026·Shihao Ji, Haotao Tan, Zihui Song +1Reward ModelingAutomated Theorem Proving
May 30, 2026·Zihan Chen, Yiming Zhang, Wenxiang Geng +2Process Reward ModelsRL for Language Model Reasoning
1HFIPS, Chinese Academy of Sciences · University of Science and Technology of China
May 30, 2026·Ibne Farabi Shihab, Fariya Afrin, Sanjeda Akter +1Process Reward ModelsLanguage Model Calibration
Department of Computer Science, Iowa State University · Department of Computer Science, Kalinga Institute of Industrial Technology · Department of Civil, Construction & Environmental Engineering, Iowa State University
May 28, 2026·Aakriti Agrawal, Minghui Liu, Furong HuangProcess Reward ModelsRL for Language Model Reasoning
University of Maryland, College Park
May 28, 2026·Shicheng Fan, Haochang Hao, Dehai Min +3Process Reward ModelsRL for Language Model Reasoning
University of Illinois Chicago
May 28, 2026·Shenghao Ye, Yu Guo, Zhengheng Li +2Process Reward ModelsRL for Language Model Reasoning
University of Science and Technology of China · Southeast University
May 27, 2026·Yifei He, Rui Yang, Hao Bai +2Reinforcement LearningProcess Reward Models
University of Illinois Urbana-Champaign
May 25, 2026·Yuelyu Ji, Min Gu Kwak, Hang Zhang +3Reward HackingRetrieval-Augmented Generation
University of Pittsburgh, Pittsburgh, PA, USA
May 23, 2026·Yuelyu Ji, Zhuochun Li, Hui Ji +1Multi-Hop QALLM Answer Verification
School of Computing and Information, University of Pittsburgh
May 23, 2026·Andreas Opedal, Francesco Ignazio Re, Abulhair Saparov +3Process Reward ModelsRL for Language Model Reasoning
αETH Zürich · γPurdue University · βMPI for Intelligent Systems, Tübingen
May 22, 2026·Sirui Chen, Lei Xu, Yuying Zhao +6Process Reward ModelsRL for Language Model Reasoning
1Tongji University · 2Shanghai AI Laboratory · 3Nanyang Technological University +3
May 15, 2026·Jinyuan Li, Langlin Huang, Chengsong Huang +5Reward ModelingProcess Reward Models
Washington University in St. Louis · Singapore University of Technology and Design
May 13, 2026·Tengda Guo, Jie Leng, Hanlei Li +6Process Reward ModelsVisual Reasoning
Tsinghua University · Peking University · Zhejiang University of Technology
May 11, 2026·Huining Yuan, Zelai Xu, Huaijie Wang +6Process Reward ModelsCredit Assignment in RL
Tsinghua University