Process Supervision

Momentum

9 papers in the last four weeks, up 125% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 53

All topics
CardsList
  1. CAPER: Clause-Aligned Process Supervision for Text-to-SQL

    Jun 2, 2026Lujie Ban, Jiasheng Shi, Jinyang Li +3Process Reward ModelsRL for Language Model Reasoning

  2. COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents

    May 29, 2026Wenkai Shen, Pengyang Zhou, Jiahe Xu +5LLM Safety AlignmentLLM Agents

  3. GTA: Generating Long-Horizon Tasks for Web Agents at Scale

    May 28, 2026Tenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey +4Computer-Use Agent BenchmarksWeb Agent Benchmarks

  4. ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs

    May 25, 2026Jiangyang Li, Cong Wan, Changjie Wu +8Visual Spatial ReasoningVLM Reasoning

  5. How to Steer Your Multi-Agent System: Human-LLM Collaborative Planning

    May 21, 2026Zeyu He, Hannah Kim, Dan Zhang +1Multi-Agent LLM SystemsProcess Supervision

  6. From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents

    May 21, 2026Murong Ma, Tianyu Chen, Yun Lin +7Supervised Fine-TuningSoftware Engineering Agents

  7. Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges

    May 19, 2026Husnain Amjad, Raja Khurram Shahzad, Aamir Shahzad +1Mathematical Reasoning BenchmarksLLM Evaluation

  8. LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition

    May 19, 2026Yanyu Chen, Jiyue Jiang, Dianzhi Yu +8RL for Language Model ReasoningProcess Supervision

  9. Self-Supervised On-Policy Distillation for Reasoning Language Models

    May 17, 2026Zhiquan Tan, Yinrong HongRL for Language Model ReasoningProcess Supervision

  10. STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning

    May 13, 2026Junjie Zhang, Guozheng Ma, Shunyu Liu +5RL for Language Model ReasoningProcess Supervision

  11. Emergence of Frontier Superposition: Möbius attractor and Cascade Supervision

    May 12, 2026Hongyu Gu, Jingwen FuTransformerProcess Supervision

  12. Dual-Track CoT: Budget-Aware Stepwise Guidance for Small LMs

    Apr 27, 2026Sagnik Chatterjee, Atharva Patil, Sricharan RameshCoT ReasoningSmall Language Models

  13. Process Supervision via Verbal Critique Improves Reasoning in Large Language Models

    Apr 23, 2026Hao-Yuan ChenInference-Time ScalingProcess Supervision

  14. V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

    Apr 22, 2026Yubo Jiang, Yitong An, Xin Yang +7Multimodal ReasoningReinforcement Learning with Verifiable Rewards

  15. GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning

    Apr 22, 2026Jingyi Wang, Lei Zhu, Tengjin Weng +8RL for Language Model ReasoningGroup Relative Policy Optimization

  16. RAWR: Reward Assignment Without Rollouts in Verifiable Domains

    Mar 18, 2026Corentin Royer, Anna Hedström, Debarun Bhattacharjya +3Process Reward ModelsReinforcement Learning with Verifiable Rewards

  17. TagPR: Tag-Guided Process Supervision for Personalization Reasoning in Large Language Models

    Sep 27, 2025Song Jin, Juntian Zhang, Ruyu Lyu +7LLM AlignmentLLM Personalization