Process Reward Models

Also known as PRM

Momentum

7 papers in the last four weeks, up 40% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 91

All topics
CardsList
  1. RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation

    Jun 20, 2026Pengzhi Yang, Xinyu Wang, Pengyu Jing +7Long-Horizon Robotic ManipulationRobot Skill Learning

  2. ARCO: Adaptive Rubric with Co-Evolution for Multi-Step LLM-Based Agents

    Jun 19, 2026Zihang Tian, Jingsen Zhang, Rui Li +3Process Reward ModelsCredit Assignment in RL

  3. From Verdict to Process: Agentic Reinforcement Learning for Multi-Stage Fact Verification

    Jun 11, 2026Rongxin Yang, Shenghong He, Siyuan Zhu +1Agentic RLProcess Reward Models

  4. The Hidden Bias of Process Reward Models:PRISM for Rewarding the Right Reasoning

    Jun 8, 2026Aakriti Agrawal, Souradip Chakraborty, Armin Saghafian +6Process Reward ModelsRL for Language Model Reasoning

  5. Improving Multimodal Reasoning via Worst Dimension Optimization

    Jun 5, 2026Haocheng Lv, Huaping Zhang, Qiuchi Li +2Process Reward ModelsMultimodal Reasoning

  6. Self-evolving LLM agents with in-distribution Optimization

    Jun 5, 2026Yudi Zhang, Meng Fang, Zhenfang Chen +1Reinforcement LearningProcess Reward Models

  7. From Correctness to Utility: Gain-Based Prefix Evaluation for LLM Reasoning

    Jun 5, 2026Yuhang Zhou, Yixin Cao, Guangnan YeProcess Reward ModelsRL for Language Model Reasoning

  8. StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents

    Jun 5, 2026Haojie Hao, Longkun Hao, Yihang Lou +8Reinforcement LearningRL for GUI Agents

  9. SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification

    Jun 3, 2026Xiangyu Zhao, Henry Hengyuan Zhao, Yiheng Wang +7Process Reward ModelsScientific Reasoning

  10. StepPRM-RTL: Stepwise Process-Reward Guided LLM Fine-Tuning for Enhanced RTL Synthesis

    Jun 2, 2026Prashanth Vijayaraghavan, Apoorva Nitsure, Luyao Shi +2RL for Code GenerationProcess Reward Models

  11. CAPER: Clause-Aligned Process Supervision for Text-to-SQL

    Jun 2, 2026Lujie Ban, Jiasheng Shi, Jinyang Li +3Process Reward ModelsRL for Language Model Reasoning

  12. ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents

    Jun 2, 2026Zheng Liu, Longxiang Zhang, Xintong Wang +8Reward ModelingProcess Reward Models

  13. From Long News to Accurate Forecast: Importance-Aware Fusion and PRM-Guided Reflection for Time Series Forecasting

    Jun 2, 2026Mingyang Liu, Qingcan Kang, Yuke Wang +6Process Reward ModelsFinancial Forecasting

  14. The Paradox of Outcome Optimization: A Causal Information-Theoretic Bound on Reasoning Shortcuts in LLMs

    May 30, 2026Zihan Chen, Yiming Zhang, Wenxiang Geng +2Process Reward ModelsRL for Language Model Reasoning

  15. EST-PRM: Stress-Testing Process Reward Models Before They Become Load-Bearing

    May 30, 2026Ibne Farabi Shihab, Fariya Afrin, Sanjeda Akter +1Process Reward ModelsLanguage Model Calibration

  16. VeriGate: Verifier-Gated Step-Level Supervision for GRPO

    May 28, 2026Aakriti Agrawal, Minghui Liu, Furong HuangProcess Reward ModelsRL for Language Model Reasoning

  17. Rubric-Guided Process Reward for Stepwise Model Routing

    May 28, 2026Shenghao Ye, Yu Guo, Zhengheng Li +2Process Reward ModelsRL for Language Model Reasoning

  18. PRO-CUA: Process-Reward Optimization for Computer Use Agents

    May 27, 2026Yifei He, Rui Yang, Hao Bai +2Reinforcement LearningProcess Reward Models

  19. StepGap: A Hybrid NLI-LLM Checker for Step-Level Evidence-Gap Detectionin Multi-Hop Question Answering

    May 23, 2026Yuelyu Ji, Zhuochun Li, Hui Ji +1Multi-Hop QALLM Answer Verification

  20. Learning to Reason Efficiently with A* Post-Training

    May 23, 2026Andreas Opedal, Francesco Ignazio Re, Abulhair Saparov +3Process Reward ModelsRL for Language Model Reasoning

  21. Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals

    May 22, 2026Sirui Chen, Lei Xu, Yuying Zhao +6Process Reward ModelsRL for Language Model Reasoning

  22. Process Rewards with Learned Reliability

    May 15, 2026Jinyuan Li, Langlin Huang, Chengsong Huang +5Reward ModelingProcess Reward Models

  23. CAVE: A Structured Credit Assignment Approach for Fragmented Visual Evidence Reasoning

    May 13, 2026Tengda Guo, Jie Leng, Hanlei Li +6Process Reward ModelsVisual Reasoning

  24. Verifiable Process Rewards for Agentic Reasoning

    May 11, 2026Huining Yuan, Zelai Xu, Huaijie Wang +6Process Reward ModelsCredit Assignment in RL