Process Reward Models

Also known as PRM

Momentum

7 papers in the last four weeks, up 40% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 91

All topics
CardsList
  1. Unsupervised Process Reward Models

    May 11, 2026Artyom Gadetsky, Maxim Kodryan, Siba Smarak Panigrahi +2Reward ModelingProcess Reward Models

  2. FormalRewardBench: A Benchmark for Formal Theorem Proving Reward Models

    May 11, 2026Zeynel A. Uluşan, Burak S. Akbudak, Can S. Erer +1Reward ModelingAutomated Theorem Proving

  3. BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models

    May 9, 2026Yuanhao Li, Hongbo Wang, Xiaotang Shang +3Automated Program RepairProcess Reward Models

  4. Distributional Process Reward Models: Calibrated Prediction of Future Rewards via Conditional Optimal Transport

    May 7, 2026Rachel Ma, Dylan Hadfield-Menell, Kristjan GreenewaldProcess Reward ModelsInference-Time Scaling

  5. Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards

    May 5, 2026Tianyang Han, Hengyu Shi, Junjie Hu +3RL for Code GenerationProcess Reward Models

  6. LSR-Ben: A Logical and Scientific Reasoning Benchmark for Evaluating Process Reward Models

    May 2, 2026Zhouhao Sun, Xuan Zhang, Xiao Ding +10Logical ReasoningProcess Reward Models

  7. Improving Vision-language Models with Perception-centric Process Reward Models

    Apr 27, 2026Yingqian Min, Kun Zhou, Yifan Li +6Process Reward ModelsObject Hallucination in VLMs

  8. DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models

    Apr 27, 2026Dake Bu, Wei Huang, Andi Han +4Doob H-TransformProcess Reward Models

  9. Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis

    Apr 27, 2026Zhisong Qiu, Shuofei Qiao, Kewei Xu +4Process Reward ModelsRL for LLM Agents

  10. ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward

    Apr 23, 2026Jingpei Wu, Xiao Han, Weixiang Shen +3Process Reward ModelsMultimodal QA

  11. ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards

    Apr 22, 2026Wentao Yan, Shengqin Wang, Huichi Zhou +4Multimodal IRProcess Reward Models

  12. RAWR: Reward Assignment Without Rollouts in Verifiable Domains

    Mar 18, 2026Corentin Royer, Anna Hedström, Debarun Bhattacharjya +3Process Reward ModelsReinforcement Learning with Verifiable Rewards

  13. Verify to Amplify: Improving Reasoning via Learned Chain-of-Thought Verification

    Mar 3, 2026Maria-Florina Balcan, Avrim Blum, Kiriaki Fragkia +2LLM EvaluationLLM Answer Verification

  14. Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning

    Feb 26, 2026Chris Samarinas, Haw-Shiuan Chang, Hamed ZamaniReinforcement LearningProcess Reward Models

  15. Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation

    Feb 10, 2026Pei-Chi Pan, Yingbin Liang, Sen LinReward ModelingReward Hacking

  16. rePIRL: Learn PRM with Inverse RL for LLM Reasoning

    Feb 8, 2026Xian Wu, Kaijie Zhu, Ying Zhang +2Reinforcement LearningProcess Reward Models

  17. MAS-ProVe: Understanding the Process Verification of Multi-Agent Systems

    Feb 3, 2026Vishal Venkataramani, Haizhou Shi, Zixuan Ke +6Multi-Agent LLM SystemsLLM-as-a-Judge

  18. SCRIBE: Structured Mid-Level Supervision for Tool-Using Language Models

    Jan 7, 2026Yuxuan Jiang, Francis FerraroProcess Reward ModelsRL for Language Model Reasoning

  19. ScalePRM: Training Process Reward Models by Scaling Verification Compute Without Ground Truth

    Dec 2, 2025Salman Rahman, Sruthi Gorantla, Arpit Gupta +3Process Reward ModelsReinforcement Learning with Verifiable Rewards

  20. Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents

    Nov 11, 2025Chih-Hsuan, Yang, Tanwi Mallick +5Multi-Agent LLM SystemsCooperative Game Theory

  21. MASPRM: Multi-Agent System Process Reward Model

    Oct 28, 2025Milad Yazdani, Mahdi Mostajabdaveh, Zirui Zhou +1Multi-Agent LLM SystemsInference-Time Search

  22. Rethinking Reward Models for Multi-Domain Test-Time Scaling

    Oct 1, 2025Dong Bok Lee, Seanie Lee, Sangwoo Park +12Reward ModelingLLM Evaluation

  23. GUI-PRA: Process Reward Agent for GUI Tasks

    Sep 27, 2025Tao Xiong, Xavier Hu, Yurun Chen +6Process Reward ModelsGUI Agents