Process-Level Supervision

Momentum

33 papers in the last four weeks, up 200% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 154

All topics
CardsList
  1. Progress Reward Modeling for Robotic Learning: A Comprehensive Survey

    Jul 22, 2026Jianshu Zhang, Keliang Wu, Haoran Lu +8Progress Reward ModelingScalable Robot Learning

  2. Scalable Low-Cost Laboratory Automation: A Digital Twin-Integrated Robotic Platform for Autonomous Liquid Handling (RAINBOT)

    Jul 22, 2026Mohamed Rami Ayeche, Souhil Sid, Ahyen Mostofa +3LaboratoryRobocasa

  3. MOF-Sleuth: Tool-Grounded Reward Alignment for Explainable Fine-Grained MOF CIF Auditing

    Jul 22, 2026Yu Liu, Zhiwei Yang, Diandian Guo +7Chemical StructuresMllm-Based

  4. Extending a Large View Synthesis Model for Multi-view Panoptic Segmentation

    Jul 22, 2026Kwonyoung Ryu, In-Jae Lee, Jonghyun Jin +3Panoptic SegmentationNovel View Synthesis

  5. DAIS: Dependency-Aware Intermediate QA Supervision for Complex Reasoning

    Jul 21, 2026Yu Wang, Ming Fan, Xicheng Zhang +5Process-Level SupervisionNatural Language Inference

  6. Step-Level Preference Learning for Generative Agents in Social Simulations

    Jul 16, 2026Wenchang Gao, Pingyue Sheng, Lanlan Qiu +7Preference LearningSimulation-Based Reinforcement Learning

  7. RainDancer: RGB-Event Video Deraining with Rain-Oriented Spiking Dynamics

    Jul 15, 2026Kui Jiang, Runzhe Li, Zhaocheng Yu +3RgbtVideo Restoration

  8. When Rubrics Change: Cross-Rubric Generalization for Critical Thinking Essay Scoring

    Jul 15, 2026Nischal Ashok Kumar, Payu Wittawatolarn, Sana Kang +7Automated Essay ScoringTask-Specific Rubrics

  9. EasyOPD: An Easy-to-use On-Policy Distillation Framework for Large Language Models

    Jul 13, 2026Jie Sun, Mao Zheng, Mingyang Song +7Efficient On-Policy DistillationRp-Opsd

  10. SCATE: Learning to Supervise Coding Agents for Cost-Effective Test Generation

    Jul 9, 2026Sijia Gu, Noor Nashid, Ali MesbahTest GenerationCoding Agents

  11. Ensemble Diversity Optimization for Subjective Supervision

    Jul 9, 2026Xia Cui, Ziyi Huang, N. R. AbeynayakeEnsembleCross-Entropy Losses

  12. VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness

    Jul 9, 2026Iulia-Maria Udrea, Alexandra Diaconu, Bogdan AlexeHigh Confidence Pseudo-LabelsVideo Dataset

  13. HELP: Human-Efficient Large-Scale Robot Post-Training with Rollout Segmentation

    Jul 8, 2026Shaopeng Zhai, Qi Zhang, Tianyi Zhang +5Humanoid RoboticsRollout

  14. What You See Is What You Get: Observation-Aligned Supervision for Chart-to-Code Generation

    Jul 6, 2026Tianhao Niu, Qingfu Zhu, Wanxiang CheImage-To-Code GenerationCode Generation

  15. Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision

    Jun 30, 2026Xianda Zheng, Huan Gao, Meng-Fen Chiang +3LLM Reasoning StrategiesClinical Reasoning Training

  16. StrucTab: A Structured Optimization Framework for Table Parsing

    Jun 29, 2026Gengluo Li, Shangpin Peng, Chengquan Zhang +10Document ParsingStructure-Aware

  17. Do Models Read What They Write? Causal Registers in Scratchpad Reasoning

    Jun 28, 2026Benjamin Shih, John Winnicki, Eric DarveProcess-Level SupervisionCausal

  18. The Weakest Link Tells It All: Outcome-Supervised Process Reward Modeling via Learnable Credit Assignment

    Jun 26, 2026Tianyu Jia, Yue Fang, Hongxin Ding +6Process Reward ModelCredit Assignment

  19. Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views

    Jun 22, 2026Jiho Choi, Seonho Lee, Seojeong Park +13D RepresentationVisual Grounding Benchmarks

  20. Quality and Agreement in Multilabel Emotion Annotation: A Case Study and Evaluation Framework

    Jun 19, 2026Emily Öhman, Anna KoufakouEmotion RecognitionMulti-Label Classification

  21. Mind the Privileged-to-Camera Gap: Actor-Centric Sidecar Supervision for Camera-First Open-Loop Waypoint Prediction

    Jun 18, 2026Feeza Khan Khanzada, Jaerock KwonWaypointsPhotometric Supervision

  22. What Makes Effective Supervision in Latent Chain-of-Thought: An Information-Theoretic Analysis

    Jun 18, 2026Xinghao Chen, Chak Tou Leong, Wenjin Guo +3Efficient Latent ReasoningChain-of-Thought Reasoning

  23. Quantifying and Auditing LLM Evaluation via Positive--Unlabeled Learning

    Jun 17, 2026Zilong Zhang, Yi-Ting Hung, Lei Ding +1Large Language Model EvaluationPositive--Unlabeled Learning

  24. APT: Atomic Physical Transitions for Causal Video-Language Understanding

    Jun 17, 2026Shang Wu, Haoran Lu, Songling Liu +6Sharp TransitionsTransitions

  25. EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning

    Jun 16, 2026Zhitong Wang, Songze Li, Hao Peng +4Agentic Reinforcement LearningLong-Horizon Agents

  26. DEEPRUBRIC: Evidence-Tree Rubric Supervision for Efficient Reinforcement Learning of Deep Research Agents

    Jun 15, 2026Minghang Zhu, Chuyang Wei, Junhao Xu +3Process-Level SupervisionOffline Reinforcement Learning

  27. Scaling LLM Reasoning from Minimal Labels: A Semi-Supervised Framework with a Lightweight Verifier

    Jun 15, 2026Keizo Kato, Chenhui Chu, Yugo Murawaki +1LLM Reasoning StrategiesProcess-Level Supervision

  28. Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes

    Jun 13, 2026Mohamed Bayan Kmainasi, Mucahid Kutlu, Ali Ezzat Shahroor +2MemesMultimodal Large Language Models

  29. From Correctness to Utility: Gain-Based Prefix Evaluation for LLM Reasoning

    Jun 5, 2026Yuhang Zhou, Yixin Cao, Guangnan YeLLM Reasoning StrategiesProcess Reward Model

  30. When Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories

    Jun 3, 2026Avinash Baidya, Xinran Liang, Ruocheng Guo +2Early Failure PredictionEarly Warning

  31. Self-supervised User Profile Generation for Personalization

    Jun 3, 2026Clark Mingxuan Ju, Yuwei Qiu, Tong Zhao +1Large Language Model PersonalizationProfile

  32. Scaling Self-Evolving Agents via Parametric Memory

    Jun 3, 2026Tao Ren, Weiyao Luo, Hui Yang +8Parametric MemorySelf-Evolving Agents

  33. DSIRM: Learning Query-Bridged Discrete Semantic Identifiers for E-commerce Relevance Modeling

    Jun 3, 2026Bokang Wang, Xing Fang, Mingmin Jin +4RelevanceProcess-Level Supervision

  34. GeoSem-WAM: Geometry- and Semantic-Aware World Action Models

    Jun 2, 2026Fulong Ma, Daojie Peng, Wenjun Yue +4Efficient World-Action ModelWorld Models

  35. From Long News to Accurate Forecast: Importance-Aware Fusion and PRM-Guided Reflection for Time Series Forecasting

    Jun 2, 2026Mingyang Liu, Qingcan Kang, Yuke Wang +6Large Language Model ForecastingTime Series Forecasting

  36. EvoPool: Evolutionary Programmatic Annotation for Label-Efficient Specialized Supervision

    Jun 1, 2026Tianyi Xu, Yaolun Zhang, Xuan Ouyang +1Human AnnotatorsMulti-Agent Evolution

  37. Semi-Supervised Hyperbolic Hierarchical Clustering with Set-Level Structural Priors

    Jun 1, 2026Junjing Zheng, Xinyu Zhang, Xiangfeng Qiu +2Semi-Supervised LearningClustering

  38. DASH: Dual-Branch Score Distillation for Guidance-Calibrated Compact Diffusion Models

    May 30, 2026Abdullah Al Shafi, Kazi Saeed Alam, Sk Imran Hossain +1Dataset DistillationText-Conditioned Diffusion Model

  39. COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents

    May 29, 2026Wenkai Shen, Pengyang Zhou, Jiahe Xu +5Safety AlignmentSearch Agents

  40. SCOPE: A Lightweight-training LLM Framework for Air Traffic Control Readback Monitoring

    May 28, 2026Qihan Deng, Minghua Zhang, Yang Yang +1Air Traffic ControlPilot

  41. GTA: Generating Long-Horizon Tasks for Web Agents at Scale

    May 28, 2026Tenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey +4Web AgentsAgentic Benchmarks

  42. Human Label Variation as Stable Signal: Learning Annotator-Specific Explanation Behavior via Cross-Annotator Preference Optimization

    May 27, 2026Beiduo Chen, Pingjun Hong, Ziyun Zhang +3Human AnnotatorsProcess-Level Supervision

  43. Activation Steering for Synthetic Data Generation: The Role of Diversity in Downstream Safety Detection

    May 27, 2026Vijeta Deshpande, Tootiya Giyahchi, Veena Padmanabhan +2Synthetic DataLinear Activation Steering

  44. Better heads do not guarantee better binarized constituency parsing

    May 27, 2026Zeyao Qi, Yige Chen, Eitan Klinger +2Syntactic StructureDocument Segmentation

  45. ESC-Skills: Discovering and Self-Evolving Skills for Emotional Support Conversations

    May 27, 2026Jie Zhu, Huaixia Dou, Shuo Jiang +5Emotional Support Conversation TaskSkill Evolution

  46. How to Steer Your Multi-Agent System: Human-LLM Collaborative Planning

    May 21, 2026Zeyu He, Hannah Kim, Dan Zhang +1Large Language Model PlanningProcess-Level Supervision

  47. REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak

    May 20, 2026Jiachen Ma, Jiawen Zhang, Xiangtian Li +3Jailbreak AttacksProcess-Level Supervision

  48. Fast and Featureless Node Representation Learning with Partial Pairwise Supervision

    May 19, 2026Sujan Chakraborty, Saptarshi BejGraph Representation LearningGraph Neural Networks

  49. LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition

    May 19, 2026Yanyu Chen, Jiyue Jiang, Dianzhi Yu +8LLM Reasoning StrategiesEfficient Latent Reasoning

  50. OmniISR: A Unified Framework for Centralized and Federated Learning via Intermediate Supervision and Regularization

    May 19, 2026Wei-Bin Kou, Guangxu Zhu, Ming Tang +4Federated LearningIntelligent Edge