Process-Level Supervision

Momentum

33 papers in the last four weeks, up 200% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 154

All topics
CardsList
  1. UniWAM: Unified World-Action Model

    Oct 1, 2026Jiayi Chen, Wenxuan Song, Jingbo Wang +13Action PredictionWorld Models

  2. GAW-PO: Preference Optimization with Gradient-Aligned Token Weights

    Oct 1, 2026Andreea Dutulescu, Stefan Ruseti, Mihai Masala +2Process-Level SupervisionAutoregressive Language Models

  3. A Matched-Budget Audit Framework for Recaptioned Image-Text Supervision Distributions

    Oct 1, 2026Giyeong Oh, Junghun Park, Yuhan Bae +1Video CaptioningText-To-Image

  4. PACT: End-to-End Learning of Human Pose, Contacts, and Forces from Video

    Sep 30, 2026Rikhat Akizhanov, Yangsong Zhang, Nikolai Kaliazin +5ForceProcess-Level Supervision

  5. SE-ADD: Self-Evolving Audio Deepfake Detection with Mistake-Driven Supervision

    Sep 30, 2026Rong Wan, Wei Xie, Jiaxi Li +4Environmental Sound Deepfake DetectionAudio Understanding

  6. AVERT-VLN: Abstention-aware Visual Error Recovery and Training for Vision-and-Language Navigation

    Sep 30, 2026Minrui Liu, Jingke Wang, Yuehao Huang +4Vision-Language NavigationProcess-Level Supervision

  7. Candidate Retention for Abductive Learning

    Sep 30, 2026Hao-Yuan He, Yu Liu, Ming LiProcess-Level SupervisionRetraining

  8. T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning

    Sep 30, 2026Bo-Wen Zhang, Junwei He, Maoqi Liu +6Agentic Reinforcement LearningProcess-Level Supervision

  9. RoboAssist: Interactive Human-Humanoid Planning for Long-Horizon Surgical Assistance

    Sep 30, 2026Jingwei Jia, Keyu Zhou, Jiewei Wang +7Human-Robot CollaborationRobocasa

  10. Learning Process Rewards via Reasoning State Propagation

    Sep 30, 2026Kai Gan, Zi-Hao Zhou, Bo Ye +3Process Reward ModelProcess-Level Supervision

  11. Can Vision-Language Models Stay Helpful When Facing Implicit Risks? Intent-Privilege OPSD for Efficient Safety-Helpfulness Alignment

    Sep 29, 2026Haotian Deng, Wenbin Xing, Gang Xu +5Process-Level Supervision

  12. Routing Should Pay for Itself: Sparse Supervision for Economical LLM Routing

    Sep 29, 2026Guannan Lai, Gelin Bian, Hao-Xuan Ma +5Large Language Model RoutingProcess-Level Supervision

  13. Inducing Process Supervision from Outcome-Only Reinforcement Learning

    Sep 29, 2026Shengda Fan, Xin Cong, Zhong Zhang +2Process Reward ModelProcess-Level Supervision

  14. SAKI: Maximal-Coupling-Routed Teacher Supervision for On-Policy Distillation

    Sep 29, 2026Miteto Wei, Xiaohan Wang, Zehao Chen +7TeacherToken-Level Supervision

  15. LLMs Learn to Evade Latent Monitors from Prior Feedback Alone

    Sep 29, 2026Hugo Lyons Keenan, Christopher Leckie, Sarah ErfaniModel ActivationsEvasion

  16. StructRL: Online Structured Reinforcement Learning for Long-Horizon Vision-Language-Action Tasks

    Sep 28, 2026Ziyi Yin, Sangmin Woo, Kang Zhou +4Long-Horizon ManipulationOffline Reinforcement Learning

  17. Improving scalable oversight with co-trained monitors

    Sep 28, 2026Joseph H. Rudoler, Kevin Tan, Benedict Tessler +2Scalable OversightProcess-Level Supervision

  18. Reward-Aligned Reweighting for On-Policy Distillation

    Sep 28, 2026Haofeng Xu, Junwei Su, Lansong Diao +2ReweightingProcess-Level Supervision

  19. Beyond Token Alignment: Event Completion for Cross-Tokenizer On-Policy Distillation

    Sep 28, 2026Jiacheng Liu, Jingwei Song, Qituan Zhang +2TeacherProcess-Level Supervision

  20. Rewarding Novel Deductions: Solver-guided Process Supervision for Logical Reasoning

    Sep 28, 2026Muhammad Asif Ali, Wenqing Wang, Huan Wang +1LLM Reasoning StrategiesReasoning Benchmark

  21. CRISP: Cultural Reward Modeling for Implicit Situated Propriety

    Sep 28, 2026Zekun Yuan, Yangfan Ye, Baohang Li +6Process-Level SupervisionTaco

  22. Dr.Credit: Rubric-Grounded Process Credit Assignment for Deep Research Agents

    Sep 28, 2026Yingjian Zhu, Zhenyi Wang, Jiaxin Guo +6Credit AssignmentProcess Reward Model

  23. Not Every Token Is Worth Distilling: Selective Supervision for Direct-OPD

    Sep 24, 2026Yibo Zhao, Zixuan Yang, Yunshi Lan +1Efficient On-Policy DistillationProcess-Level Supervision

  24. Cognitive Action Reasoning for Proactive Robots from Human-Centered Multimodal Observations

    Sep 20, 2026Zhihao Gu, Kechao Zhu, Yuanfeng Wu +7Theory-Of-Mind ReasoningProcess-Level Supervision

  25. INSPECT: Learning Robot View Selection from Assistant Use

    Sep 17, 2026Di Wen, Kailun Yang, Wenhao Guo +7Robotic PerceptionInspection

  26. ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training

    Sep 15, 2026Zhihao Zhang, Mingqi Wu, Qiaole Dong +15Post-TrainingProcess-Level Supervision

  27. Explainable Prediction from Mobile Sensing Data through LLM-guided Concept Integration

    Sep 14, 2026Yuning Wang, Iman Azimi, Amir M. Rahmani +1Clinical PredictionMulti-Model Study

  28. Beyond Verified Answers: Solver-Informed Self-Distillation for Bootstrapping Operations Research Language Models

    Sep 12, 2026Rui Zhu, Minglong Cao, Chenyu Zhou +2Operations ResearchSelf-Distillation Framework

  29. AgentGrad: Intervention-guided Prompt Optimization for Multi Agent Systems

    Sep 8, 2026Jaewon Chu, Jinwoo Seo, Jaewon Cho +4Process-Level SupervisionPrompt Optimization

  30. What Do Scan-Derived Class Prototypes Add? Disentangling Supervision, Prototype Content and Query Protocol in Recognition over Frozen Foundation Features

    Sep 3, 2026Chenxi Tao, Hong-In Won, Seung-Kyum ChoiLearnable PrototypesDinov3

  31. Making Every Tool Call Count: Necessary Tool-Evidence Path Rewards for Agentic Vision-Language Models

    Sep 3, 2026Xingming Long, Yu Liu, Zhiwei Yang +7Recent Vision-Language ModelsProcess-Level Supervision

  32. Dense Process Supervision for Search Agents via Fact Utility Estimation

    Sep 1, 2026Rongzhi Zhu, Xiangyu Liu, Yi Liu +7Process Reward ModelCredit Assignment

  33. Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

    Aug 31, 2026Zhiqin Yang, Jingwen Fu, Yuhan Liu +16Process-Level SupervisionLarge Reasoning Models

  34. Beyond Information Seeking: Severity-Aware Question Supervision for Proactive Medical Dialogue

    Aug 25, 2026Chenxuan Li, Xinrong Chen, Luyan Zhang +5QuestionProcess-Level Supervision

  35. Refusing Intent, Not Form: Wrapper-Based Intent-Group Supervision for LLM Safety

    Aug 13, 2026Ping Wu, Haibo Tong, Feifei Zhao +7RefusalsLarge Language Model Safety

  36. HPSD: Hybrid-Policy Self-Distillation for Text-Image-to-Video Diffusion Models

    Aug 13, 2026Jiazi Bu, Pengyang Ling, Yujie Zhou +10Text-To-Video Diffusion ModelsText-To-Video Generation Model

  37. Moose: Latent concept learning with reasoning-shortcut awareness in EL++\mathcal{EL}^{++}

    Aug 13, 2026Olga Mashkova, Asaad Mohammedsaleh, Fernando Zhapa-Camacho +1OntologyEfficient Latent Reasoning

  38. UniMoFlow: Grounding Instruction-Driven 3D Human Motion Editing in Generation

    Aug 10, 2026Yilei Hua, Beibei Jing, Ce Zheng +3Human Motion GenerationText-To-Motion Generation

  39. Adaptive Supervised Anchoring for On-Policy Self-Distillation

    Aug 8, 2026Meilin Yang, Zixuan Ding, Jianhao Nie +5Unsupervised On-Policy Self-DistillationProcess-Level Supervision

  40. Positive-Unlabeled Preference Optimization For Chest X-ray Report Generation

    Aug 5, 2026Yuta Kobayashi, Pradyun Ramesh, Muhammad Ahmed Chaudhry +5Radiology Report GenerationMedical Vision-Language Models

  41. FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory

    Aug 5, 2026Zhuoran Zhang, Bowen Li, Jingcheng Ju +5Episodic MemoryReadout

  42. Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

    Aug 3, 2026Fangxu Yu, Tao Feng, Dehai Min +6Audio UnderstandingProcess-Level Supervision

  43. Wnuan: Staged Post-Training for Question Answering over Proprietary Enterprise Knowledge

    Aug 3, 2026Xiaofeng Shi, Xiaosong Qiu, Wenxin Ma +6Supervised FinetuningPost-Training

  44. Credit the Right Box: Marginal Contribution Assignment for Structured Visual Perception

    Aug 2, 2026Xinheng Han, Jianfei Wang, Yu Chen +4Process-Level SupervisionContextual Grounding

  45. Group-wise Supervision with Focal-Dice Loss for Long-Tailed Indoor Semantic Occupancy Prediction

    Jul 31, 2026Qi Zheng, Zihuang Su, Xiao Pan3D Semantic Occupancy PredictionOpen-Vocabulary 3D Segmentation

  46. Explicit Layer Modeling for Video Object Insertion and Video Layer Decomposition

    Jul 28, 2026Kyujin Han, Seungjoo Shin, Sunghyun ChoLayer-WiseDecomposition

  47. Inverse RL Helps Align AI by Imitating Humans

    Jul 27, 2026Michał Wiliński, Liu Leqi, Chirag NagpalLarge Language Model AlignmentReinforcement Learning From Human Feedback

  48. Head Avatars with Dynamic Explicit Hair

    Jul 26, 2026Vanessa Sklyarova, Haonan Chen, Berna Kabadayi +8Animatable 3D Human AvatarsAvatars

  49. Anticipatory Risk-Guided Reinforcement Learning for Safe Flight Through Dynamic Clutter

    Jul 26, 2026Yuchao Mei, Guohao Zhang, Luxia Ai +2QuadrotorCollision Prediction

  50. SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

    Jul 25, 2026Yang Wan, Zhenhao Zhang, Jierui Wang +1Computer-Use AgentsModel Judgments

  51. CSPF: A Constrained Shared-Private Fusion Method for Non-Verifiable Preference Evaluation

    Jul 23, 2026Hehao Zhang, Danli Wang, Xinyuan Wang +1Preference Alignment LearningMulti-Dimensional Evaluation