Process Supervision

Momentum

9 papers in the last four weeks, up 125% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 53

All topics
CardsList
  1. HaPRL: Human-Anchored Process Reinforcement Learning for Visual Search Agent

    Sep 29, 2026Zhangquan Chen, Yaoxin Niu, Xiang An +5Human-in-the-Loop AnnotationProcess Supervision

  2. Rewarding Novel Deductions: Solver-guided Process Supervision for Logical Reasoning

    Sep 28, 2026Muhammad Asif Ali, Wenqing Wang, Huan Wang +1RL for Language Model ReasoningProcess Supervision

  3. Reinforcement Learning from Intermediate Renders for Image-to-Code Generation

    Sep 28, 2026Omri Kaduri, Kate Feingold, Phillip Isola +1RL for Code GenerationCode Generation

  4. FLARE: A Full-Lifecycle Dense Supervision Paradigm for Long-Horizon Coding Agents via Generative Reward Model

    Sep 20, 2026Jingxuan Xu, Gang Wu, Yanan Wu +13RL for Code GenerationReward Modeling

  5. Structural Process Supervision for Latent Chain-of-Thought Reasoning

    Sep 9, 2026Yiqi Li, Xu Chen, Chen Ju +5Representation LearningProcess Supervision

  6. IPM-FM: A Foundation Model with Consensus Feature Selection for Industrial Process Monitoring

    Sep 8, 2026Liang Cao, Weide Liu, Yan Qin +3Predictive Process MonitoringProcess Supervision

  7. SiLR: Structure-Preserving Admission and Process Reward for LLM Tool Agents

    Sep 7, 2026Chenyu Zhou, Qiliang Jiang, Shuning Wu +1Constrained RLRuntime Enforcement for AI Agents

  8. Cliff: Learning Process Rewards from the First Mistake

    Sep 2, 2026Peixuan Han, Runhui Wang, Ketan Ramaneti +3Reinforcement Learning with Verifiable RewardsLLM Reasoning

  9. Monitoring Web Agents Without Internal Signals: Observable Trajectories and Key-Step Supervision

    Sep 2, 2026Sitong Pan, Yipeng Shen, Yilin Lu +3AI Agent MonitoringProcess Supervision

  10. Dense Process Supervision for Search Agents via Fact Utility Estimation

    Sep 1, 2026Rongzhi Zhu, Xiangyu Liu, Yi Liu +7Reinforcement LearningCredit Assignment in RL

  11. Advantage-Guided Gate: Reshaping Open-Ended Reasoning for Vision-Based Spatial Intelligence

    Aug 8, 2026Ling Lin, Yang Bai, Congcong Zhu +6Visual Spatial ReasoningInference-Time Search

  12. PAMT: Process-Aligned Reinforcement Learning for Multi-Domain Machine Translation

    Aug 4, 2026Yongshi Ye, Biao Fu, Chongxuan Huang +2RL for Language Model ReasoningProcess Supervision

  13. SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

    Jul 2, 2026Jiayin Zhu, Kelong Mao, Yudong Guo +4LLM Agent EvaluationLLM Agent Skill Learning

  14. FaithMed: Training LLMs For Faithful Evidence-Based Medical Reasoning

    Jul 1, 2026Zhiyun Zhang, Liwen Sun, Xiang Qian +1RL for Language Model ReasoningProcess Supervision

  15. GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision

    Jul 1, 2026Dianyu Wang, Peirong Zhang, Xuyang Li +2Vision-Language GroundingVLM Reasoning

  16. Do Models Read What They Write? Causal Registers in Scratchpad Reasoning

    Jun 28, 2026Benjamin Shih, John Winnicki, Eric DarveCoT FaithfulnessCoT Reasoning

  17. OpenRCA 2.0: From Outcome Labels to Causal Process Supervision

    Jun 25, 2026Aoyang Fang, Yifan Yang, Jin'ao Shang +7LLM Agent EvaluationCausal Attribution

  18. A cross-process welding penetration status prediction algorithm based on unsupervised domain adaptation in laser and TIG welding

    Jun 24, 2026Sen Li, Haichao Cui, Chendong Shao +2Unsupervised Domain AdaptationDomain Adaptation

  19. Process-Reward Tactic Evolution for Long-Horizon Bioinformatics Workflows

    Jun 18, 2026Lingzhi Yang, Yubo Fan, Song Wu +1LLM Agent Skill LearningProcess Supervision

  20. Topological Data Analysis for High-Dimensional Dynamic Process Monitoring

    Jun 18, 2026Angan Mukherjee, Tyler A. Soderstrom, Michael J. Kurtz +1Process SupervisionTopological Representation Learning

  21. What Makes Effective Supervision in Latent Chain-of-Thought: An Information-Theoretic Analysis

    Jun 18, 2026Xinghao Chen, Chak Tou Leong, Wenjin Guo +3Continuous Latent ReasoningProcess Supervision

  22. GraphPO: Graph-based Policy Optimization for Reasoning Models

    Jun 17, 2026Yuliang Zhan, Xinyu Tang, Jian Li +7Reinforcement LearningLLM Reasoning with Graphs

  23. Video-Based Prediction of In-Flight Particle Characteristics in Atmospheric Plasma Spraying

    Jun 5, 2026Abhijeet Praveen, Sareh Soleimani, Cormac Cureton +4Materials ScienceVideo Prediction