Process Supervision

Momentum

9 papers in the last four weeks, up 125% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 53

All topics
CardsList
  1. HaPRL: Human-Anchored Process Reinforcement Learning for Visual Search Agent

    Sep 29, 2026Zhangquan Chen, Yaoxin Niu, Xiang An +5Human-in-the-Loop AnnotationProcess Supervision

  2. Rewarding Novel Deductions: Solver-guided Process Supervision for Logical Reasoning

    Sep 28, 2026Muhammad Asif Ali, Wenqing Wang, Huan Wang +1RL for Language Model ReasoningProcess Supervision

  3. Reinforcement Learning from Intermediate Renders for Image-to-Code Generation

    Sep 28, 2026Omri Kaduri, Kate Feingold, Phillip Isola +1RL for Code GenerationCode Generation

  4. FLARE: A Full-Lifecycle Dense Supervision Paradigm for Long-Horizon Coding Agents via Generative Reward Model

    Sep 20, 2026Jingxuan Xu, Gang Wu, Yanan Wu +13RL for Code GenerationReward Modeling

  5. Structural Process Supervision for Latent Chain-of-Thought Reasoning

    Sep 9, 2026Yiqi Li, Xu Chen, Chen Ju +5Representation LearningProcess Supervision

  6. IPM-FM: A Foundation Model with Consensus Feature Selection for Industrial Process Monitoring

    Sep 8, 2026Liang Cao, Weide Liu, Yan Qin +3Predictive Process MonitoringProcess Supervision

  7. SiLR: Structure-Preserving Admission and Process Reward for LLM Tool Agents

    Sep 7, 2026Chenyu Zhou, Qiliang Jiang, Shuning Wu +1Constrained RLRuntime Enforcement for AI Agents

  8. Cliff: Learning Process Rewards from the First Mistake

    Sep 2, 2026Peixuan Han, Runhui Wang, Ketan Ramaneti +3Reinforcement Learning with Verifiable RewardsLLM Reasoning

  9. Monitoring Web Agents Without Internal Signals: Observable Trajectories and Key-Step Supervision

    Sep 2, 2026Sitong Pan, Yipeng Shen, Yilin Lu +3AI Agent MonitoringProcess Supervision

  10. Dense Process Supervision for Search Agents via Fact Utility Estimation

    Sep 1, 2026Rongzhi Zhu, Xiangyu Liu, Yi Liu +7Reinforcement LearningCredit Assignment in RL

  11. Advantage-Guided Gate: Reshaping Open-Ended Reasoning for Vision-Based Spatial Intelligence

    Aug 8, 2026Ling Lin, Yang Bai, Congcong Zhu +6Visual Spatial ReasoningInference-Time Search

  12. PAMT: Process-Aligned Reinforcement Learning for Multi-Domain Machine Translation

    Aug 4, 2026Yongshi Ye, Biao Fu, Chongxuan Huang +2RL for Language Model ReasoningProcess Supervision

  13. SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

    Jul 2, 2026Jiayin Zhu, Kelong Mao, Yudong Guo +4LLM Agent EvaluationLLM Agent Skill Learning

  14. FaithMed: Training LLMs For Faithful Evidence-Based Medical Reasoning

    Jul 1, 2026Zhiyun Zhang, Liwen Sun, Xiang Qian +1RL for Language Model ReasoningProcess Supervision

  15. GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision

    Jul 1, 2026Dianyu Wang, Peirong Zhang, Xuyang Li +2Vision-Language GroundingVLM Reasoning

  16. Do Models Read What They Write? Causal Registers in Scratchpad Reasoning

    Jun 28, 2026Benjamin Shih, John Winnicki, Eric DarveCoT FaithfulnessCoT Reasoning

  17. OpenRCA 2.0: From Outcome Labels to Causal Process Supervision

    Jun 25, 2026Aoyang Fang, Yifan Yang, Jin'ao Shang +7LLM Agent EvaluationCausal Attribution

  18. A cross-process welding penetration status prediction algorithm based on unsupervised domain adaptation in laser and TIG welding

    Jun 24, 2026Sen Li, Haichao Cui, Chendong Shao +2Unsupervised Domain AdaptationDomain Adaptation

  19. Process-Reward Tactic Evolution for Long-Horizon Bioinformatics Workflows

    Jun 18, 2026Lingzhi Yang, Yubo Fan, Song Wu +1LLM Agent Skill LearningProcess Supervision

  20. Topological Data Analysis for High-Dimensional Dynamic Process Monitoring

    Jun 18, 2026Angan Mukherjee, Tyler A. Soderstrom, Michael J. Kurtz +1Process SupervisionTopological Representation Learning

  21. What Makes Effective Supervision in Latent Chain-of-Thought: An Information-Theoretic Analysis

    Jun 18, 2026Xinghao Chen, Chak Tou Leong, Wenjin Guo +3Continuous Latent ReasoningProcess Supervision

  22. GraphPO: Graph-based Policy Optimization for Reasoning Models

    Jun 17, 2026Yuliang Zhan, Xinyu Tang, Jian Li +7Reinforcement LearningLLM Reasoning with Graphs

  23. Video-Based Prediction of In-Flight Particle Characteristics in Atmospheric Plasma Spraying

    Jun 5, 2026Abhijeet Praveen, Sareh Soleimani, Cormac Cureton +4Materials ScienceVideo Prediction

  24. CAPER: Clause-Aligned Process Supervision for Text-to-SQL

    Jun 2, 2026Lujie Ban, Jiasheng Shi, Jinyang Li +3Process Reward ModelsRL for Language Model Reasoning

  25. COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents

    May 29, 2026Wenkai Shen, Pengyang Zhou, Jiahe Xu +5LLM Safety AlignmentLLM Agents

  26. GTA: Generating Long-Horizon Tasks for Web Agents at Scale

    May 28, 2026Tenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey +4Computer-Use Agent BenchmarksWeb Agent Benchmarks

  27. ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs

    May 25, 2026Jiangyang Li, Cong Wan, Changjie Wu +8Visual Spatial ReasoningVLM Reasoning

  28. How to Steer Your Multi-Agent System: Human-LLM Collaborative Planning

    May 21, 2026Zeyu He, Hannah Kim, Dan Zhang +1Multi-Agent LLM SystemsProcess Supervision

  29. From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents

    May 21, 2026Murong Ma, Tianyu Chen, Yun Lin +7Supervised Fine-TuningSoftware Engineering Agents

  30. Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges

    May 19, 2026Husnain Amjad, Raja Khurram Shahzad, Aamir Shahzad +1Mathematical Reasoning BenchmarksLLM Evaluation

  31. LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition

    May 19, 2026Yanyu Chen, Jiyue Jiang, Dianzhi Yu +8RL for Language Model ReasoningProcess Supervision

  32. Self-Supervised On-Policy Distillation for Reasoning Language Models

    May 17, 2026Zhiquan Tan, Yinrong HongRL for Language Model ReasoningProcess Supervision

  33. STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning

    May 13, 2026Junjie Zhang, Guozheng Ma, Shunyu Liu +5RL for Language Model ReasoningProcess Supervision

  34. Emergence of Frontier Superposition: Möbius attractor and Cascade Supervision

    May 12, 2026Hongyu Gu, Jingwen FuTransformerProcess Supervision

  35. Dual-Track CoT: Budget-Aware Stepwise Guidance for Small LMs

    Apr 27, 2026Sagnik Chatterjee, Atharva Patil, Sricharan RameshCoT ReasoningSmall Language Models

  36. Process Supervision via Verbal Critique Improves Reasoning in Large Language Models

    Apr 23, 2026Hao-Yuan ChenInference-Time ScalingProcess Supervision

  37. V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

    Apr 22, 2026Yubo Jiang, Yitong An, Xin Yang +7Multimodal ReasoningReinforcement Learning with Verifiable Rewards

  38. GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning

    Apr 22, 2026Jingyi Wang, Lei Zhu, Tengjin Weng +8RL for Language Model ReasoningGroup Relative Policy Optimization

  39. RAWR: Reward Assignment Without Rollouts in Verifiable Domains

    Mar 18, 2026Corentin Royer, Anna Hedström, Debarun Bhattacharjya +3Process Reward ModelsReinforcement Learning with Verifiable Rewards

  40. TagPR: Tag-Guided Process Supervision for Personalization Reasoning in Large Language Models

    Sep 27, 2025Song Jin, Juntian Zhang, Ruyu Lyu +7LLM AlignmentLLM Personalization