Process Reward Models

Also known as PRM

Momentum

7 papers in the last four weeks, up 40% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 91

All topics
CardsList
  1. World Potential Model: Pretrained World Knowledge as Progress Potentials

    Oct 7, 2026Jun Zhao, Jixin Tang, Yang Shu +6Long-Horizon LLM AgentsRL for LLM Agents

  2. EnGRICH: Enhancing Generative Reward Modeling with Critiques from Humans

    Oct 4, 2026Xuancheng Li, Beining Wang, Haitao Li +7Reward ModelingProcess Reward Models

  3. Learning Process Rewards via Reasoning State Propagation

    Sep 30, 2026Kai Gan, Zi-Hao Zhou, Bo Ye +3Process Reward ModelsRL for Language Model Reasoning

  4. Inducing Process Supervision from Outcome-Only Reinforcement Learning

    Sep 29, 2026Shengda Fan, Xin Cong, Zhong Zhang +2Reinforcement LearningProcess Reward Models

  5. ARS: Agentic Reward System for Robot Learning

    Sep 28, 2026Sheng Hu, Weiyi Lu, Lingbing Zeng +5RL for RoboticsProcess Reward Models

  6. Rewarding Reasoning, Not Answers: Fixing and Bounding Test-Time Reinforcement Learning on Medical QA

    Sep 15, 2026Kailong Fan, Anqi Pu, Yichen Wu +7Process Reward ModelsRL for Language Model Reasoning

  7. Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning

    Sep 3, 2026Kevin Du, Alexander Hoyle, Laura Ruis +1CoT FaithfulnessProcess Reward Models

  8. Mitigating Over-Optimization in PRM-Guided Search in Mathematical Reasoning by Optimizing the Guide

    Aug 30, 2026Taejong Joo, Diego KlabjanInference-Time SearchProcess Reward Models

  9. SPEAR: Distilling Domain-Adaptive Reasoning Skeletons via Sequential Symbolic Alignment in Reinforcement Learning

    Aug 27, 2026Zhuochun Li, Yuelyu Ji, Yiming Zeng +1Process Reward ModelsRL for Language Model Reasoning

  10. SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward

    Aug 12, 2026Zile Zhou, Huining Yuan, Weichen Zhang +2Visual Spatial ReasoningProcess Reward Models

  11. Quality-Diversity Stress Tests for Process Reward Models:What Archive Coverage Can and Cannot Certify

    Aug 8, 2026Ibne Farabi Shihab, Fariya AfrinProcess Reward ModelsAdversarial Attacks

  12. BiCAA: Bidirectional Credit Assignment for Search-Augmented Agent

    Aug 2, 2026Yibin Huang, Bin Xu, Hailong Cao +1Process Reward ModelsCredit Assignment in RL

  13. Learning Latent Reasoning Traces for Scalar Reward Models End-to-End

    Jul 31, 2026Sanwoo Lee, Clive Bai, Hsiu-Yuan Huang +3Reward ModelingLLM Alignment

  14. Progress Reward Modeling for Robotic Learning: A Comprehensive Survey

    Jul 22, 2026Jianshu Zhang, Keliang Wu, Haoran Lu +8Reward ModelingProcess Reward Models

  15. Rewarding Better Thinking for LLM Preference Alignment

    Jul 22, 2026Xubo Liu, Wenya Guo, Ruxue Yan +2Process Reward ModelsCredit Assignment in RL

  16. KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling

    Jul 10, 2026Peng Kuang, Haibo Jin, Xiaoyu Han +5Process Reward ModelsKV Caching

  17. TimeThink: Reasoning with Time for Video LLMs

    Jul 6, 2026Handong Li, Longteng Guo, Zikang Liu +8Temporal Video GroundingProcess Reward Models

  18. Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning

    Jun 30, 2026Junha Jung, Minbyul Jeong, Suhyeon Lim +5Process Reward ModelsMedical VQA

  19. SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution

    Jun 29, 2026Aojie Yuan, Yi Nian, Haiyue Zhang +2AI Agent ReliabilityProcess Reward Models

  20. Process Advantage Signal Shaping: A Paradigm-Agnostic Middleware for Process-Supervised RL in LLM Reasoners

    Jun 28, 2026Chao Wang, Hongtao Tian, Tao Yang +3Reinforcement LearningProcess Reward Models

  21. The Weakest Link Tells It All: Outcome-Supervised Process Reward Modeling via Learnable Credit Assignment

    Jun 26, 2026Tianyu Jia, Yue Fang, Hongxin Ding +6Process Reward ModelsFine-Grained Credit Assignment

  22. Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents

    Jun 24, 2026Changdae Oh, Wendi Li, Seongheon Park +3Process Reward ModelsRL Post-Training