Process Reward Model

Latest papers 69

All topics
CardsList
  1. Learning Process Rewards via Reasoning State Propagation

    Sep 30, 2026Kai Gan, Zi-Hao Zhou, Bo Ye +3Process Reward ModelProcess-Level Supervision

  2. Inducing Process Supervision from Outcome-Only Reinforcement Learning

    Sep 29, 2026Shengda Fan, Xin Cong, Zhong Zhang +2Process Reward ModelProcess-Level Supervision

  3. Why Deterministic PRM Guidance Underperforms in Discrete Diffusion Reasoning

    Sep 28, 2026Yan Zhan, Shaobo Liu, Zhijun GaoDiffusion Language ModelsProcess Reward Model

  4. Dr.Credit: Rubric-Grounded Process Credit Assignment for Deep Research Agents

    Sep 28, 2026Yingjian Zhu, Zhenyi Wang, Jiaxin Guo +6Credit AssignmentProcess Reward Model

  5. Counterfactual Rollout Replay: Forkable Environments as Free Process Rewards for Software Engineering Agents

    Sep 27, 2026Yuanhao Li, Hongbo Wang, Xuhong Chen +2Counterfactual LearningSoftware Engineering

  6. Rewarding Reasoning, Not Answers: Fixing and Bounding Test-Time Reinforcement Learning on Medical QA

    Sep 15, 2026Kailong Fan, Anqi Pu, Yichen Wu +7Process Reward ModelAnswer

  7. Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning

    Sep 3, 2026Kevin Du, Alexander Hoyle, Laura Ruis +1Reasoning ChainReasoning Traces

  8. Dense Process Supervision for Search Agents via Fact Utility Estimation

    Sep 1, 2026Rongzhi Zhu, Xiangyu Liu, Yi Liu +7Process Reward ModelCredit Assignment

  9. Mitigating Over-Optimization in PRM-Guided Search in Mathematical Reasoning by Optimizing the Guide

    Aug 30, 2026Taejong Joo, Diego KlabjanProcess Reward ModelMathematical Reasoning

  10. SPEAR: Distilling Domain-Adaptive Reasoning Skeletons via Sequential Symbolic Alignment in Reinforcement Learning

    Aug 27, 2026Zhuochun Li, Yuelyu Ji, Yiming Zeng +1Process Reward ModelKnowledge Distillation

  11. SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward

    Aug 12, 2026Zile Zhou, Huining Yuan, Weichen Zhang +23D Spatial ReasoningSpatial Reasoning

  12. Quality-Diversity Stress Tests for Process Reward Models:What Archive Coverage Can and Cannot Certify

    Aug 8, 2026Ibne Farabi Shihab, Fariya AfrinProcess Reward ModelStress Testing

  13. Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models

    Aug 3, 2026Wonseok Lee, Jimyeong Kim, Jungmin Ko +1Large Language Model Reinforcement LearningAutoregressive Rollout

  14. BiCAA: Bidirectional Credit Assignment for Search-Augmented Agent

    Aug 2, 2026Yibin Huang, Bin Xu, Hailong Cao +1Search AgentsSearch-Augmented Reasoning

  15. KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling

    Jul 10, 2026Peng Kuang, Haibo Jin, Xiaoyu Han +5Process Reward ModelTest-Time Scaling

  16. Improving LLM-Generated Process Model Quality Through Reinforcement Learning: The Role of Reward Function Design

    Jul 7, 2026Alexander Rombach, Chantale Lauer, Nijat MehdiyevProcess Reward ModelLarge Language Model Reinforcement Learning

  17. FaithMed: Training LLMs For Faithful Evidence-Based Medical Reasoning

    Jul 1, 2026Zhiyun Zhang, Liwen Sun, Xiang Qian +1Clinical Reasoning TrainingLLM Reasoning Strategies

  18. Process Advantage Signal Shaping: A Paradigm-Agnostic Middleware for Process-Supervised RL in LLM Reasoners

    Jun 28, 2026Chao Wang, Hongtao Tian, Tao Yang +3Process Reward ModelLLM Reasoning Strategies

  19. The Weakest Link Tells It All: Outcome-Supervised Process Reward Modeling via Learnable Credit Assignment

    Jun 26, 2026Tianyu Jia, Yue Fang, Hongxin Ding +6Process Reward ModelCredit Assignment

  20. The Hidden Bias of Process Reward Models:PRISM for Rewarding the Right Reasoning

    Jun 8, 2026Aakriti Agrawal, Souradip Chakraborty, Armin Saghafian +6Process Reward ModelContrastive Learning

  21. Improving Multimodal Reasoning via Worst Dimension Optimization

    Jun 5, 2026Haocheng Lv, Huaping Zhang, Qiuchi Li +2Multimodal ReasoningProcess Reward Model

  22. From Correctness to Utility: Gain-Based Prefix Evaluation for LLM Reasoning

    Jun 5, 2026Yuhang Zhou, Yixin Cao, Guangnan YeLLM Reasoning StrategiesProcess Reward Model

  23. StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents

    Jun 5, 2026Haojie Hao, Longkun Hao, Yihang Lou +8Process Reward ModelGraphical User Interface Agents

  24. SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification

    Jun 3, 2026Xiangyu Zhao, Henry Hengyuan Zhao, Yiheng Wang +7Process Reward ModelScientific Discovery

  25. ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents

    Jun 2, 2026Zheng Liu, Longxiang Zhang, Xintong Wang +8Process Reward ModelSearch Agents

  26. Predicting Inference-Time Scaling Gains from Labeled Validation-Set Output Statistics

    Jun 2, 2026Luyang Zhang, Jingyan LiBest-Of-NInference-Time

  27. Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs

    May 30, 2026Jiakang Li, Guanyu Zhu, Can Jin +8LLM Reasoning StrategiesProcess Reward Model

  28. The Paradox of Outcome Optimization: A Causal Information-Theoretic Bound on Reasoning Shortcuts in LLMs

    May 30, 2026Zihan Chen, Yiming Zhang, Wenxiang Geng +2LLM Reasoning StrategiesProcess Reward Model

  29. EST-PRM: Stress-Testing Process Reward Models Before They Become Load-Bearing

    May 30, 2026Ibne Farabi Shihab, Fariya Afrin, Sanjeda Akter +1Process Reward ModelCorrectness

  30. Rubric-Guided Process Reward for Stepwise Model Routing

    May 28, 2026Shenghao Ye, Yu Guo, Zhengheng Li +2Process Reward ModelLarge Language Model Routing

  31. PRO-CUA: Process-Reward Optimization for Computer Use Agents

    May 27, 2026Yifei He, Rui Yang, Hao Bai +2Process Reward ModelOn-Policy

  32. Retrieval, Reward, and Training Protocols: What Matters in Training Search Agents?

    May 27, 2026Yibo Zhao, Zichen Ding, Jiayi Wu +2Search AgentsProcess Reward Model

  33. PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization

    May 18, 2026Wonjoong Kim, Yeonjun In, Sangwu Park +2Process Reward ModelInference Cost

  34. Process Rewards with Learned Reliability

    May 15, 2026Jinyuan Li, Langlin Huang, Chengsong Huang +5Process Reward Model

  35. Unsupervised Process Reward Models

    May 11, 2026Artyom Gadetsky, Maxim Kodryan, Siba Smarak Panigrahi +2Process Reward ModelLLM Reasoning Strategies

  36. Reinforcement Learning Measurement Model

    May 10, 2026Wenqian Xu, Feng JiProcess Reward ModelOffline Reinforcement Learning

  37. EvoMAS: Learning Execution-Time Workflows for Multi-Agent Systems

    May 9, 2026Chengdong Xu, Kaiqiang Ke, Ziheng Liu +4Multi-Agent WorkflowsMulti-Agent Coordination

  38. Distributional Process Reward Models: Calibrated Prediction of Future Rewards via Conditional Optimal Transport

    May 7, 2026Rachel Ma, Dylan Hadfield-Menell, Kristjan GreenewaldProcess Reward ModelQuantile Regression

  39. Every Step Counts: Step-Level Credit Assignment for Tool-Integrated Text-to-SQL

    May 6, 2026Yaxun Dai, Baolin Sun, Junying Wang +6Text-To-SqlCredit Assignment

  40. LSR-Ben: A Logical and Scientific Reasoning Benchmark for Evaluating Process Reward Models

    May 2, 2026Zhouhao Sun, Xuan Zhang, Xiao Ding +10Reasoning BenchmarkProcess Reward Model

  41. Improving Vision-language Models with Perception-centric Process Reward Models

    Apr 27, 2026Yingqian Min, Kun Zhou, Yifan Li +6Recent Vision-Language ModelsProcess Reward Model

  42. Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis

    Apr 27, 2026Zhisong Qiu, Shuofei Qiao, Kewei Xu +4Process Reward ModelData Science Agents

  43. ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward

    Apr 23, 2026Jingpei Wu, Xiao Han, Weixiang Shen +3Multimodal ReasoningProcess Reward Model

  44. RAWR: Reward Assignment Without Rollouts in Verifiable Domains

    Mar 18, 2026Corentin Royer, Anna Hedström, Debarun Bhattacharjya +3Process Reward ModelReinforcement Learning With Verifiable Reward

  45. Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning

    Feb 26, 2026Chris Samarinas, Haw-Shiuan Chang, Hamed ZamaniProcess Reward ModelCredit Assignment