Token-Level Supervision

Momentum

12 papers in the last four weeks, up 200% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 44

All topics
CardsList
  1. RISED: RubrIcs for agentic multi-environment Selection and sElf-Distillation

    Oct 1, 2026Jingtan Wang, Sirajul Salekin, Young mok Jung +3Mixture-Of-AgentsReward Functions

  2. Recovering Off-Policy Supervision for Speculative Decoding

    Sep 30, 2026Jungseob Lee, Chanjun Park, Sugyeong Eo +1Speculative DecodingDrafts

  3. Cross-Entropy Guided Routing in Mixture-of-Experts Large Language Models

    Sep 29, 2026Yury Nahshan, Nati Daniel, Jacob Goldberger +1Mixture-Of-Experts Large Language ModelsMixture-Of-Experts Architectures

  4. SAKI: Maximal-Coupling-Routed Teacher Supervision for On-Policy Distillation

    Sep 29, 2026Miteto Wei, Xiaohan Wang, Zehao Chen +7TeacherToken-Level Supervision

  5. The Safety Operator: Modulating the Expression of Safety Instructions via Spectral Optimization

    Sep 29, 2026Benoit Dherin, Michael Munn, Xavier Gonzalvo +14Safety ClaimsInstruction Tuning

  6. Rubric-Aware On-Policy Self-Distillation for LLM Personalization

    Sep 28, 2026Yilun Qiu, Xiaoyan Zhao, Chengbing Wang +6Large Language Model PersonalizationPersonalization

  7. MAS-OPD: On-Policy Distillation for Multi-agent Systems

    Sep 28, 2026Qiyong Zhong, Mao Zheng, Mingyang Song +5Aware Heterogeneous Multi-Teacher Multimodal On-Policy DistillationToken-Level Supervision

  8. Learn Your Own Thoughts: Abstract Token Curriculum

    Sep 17, 2026Khashayar Gatmiry, Avrajit Ghosh, Parsa Mirtaheri +4ThoughtsToken-Level Supervision

  9. Reason What Matters: Retrieval-Grounded Reasoning for Universal Multimodal Embeddings

    Sep 14, 2026Mingzhou Jiang, Peixi Wu, Hang Cheng +7Multimodal EmbeddingsMultimodal Reasoning

  10. Structural Process Supervision for Latent Chain-of-Thought Reasoning

    Sep 9, 2026Yiqi Li, Xu Chen, Chen Ju +5Efficient Latent ReasoningToken-Level Supervision

  11. Extremely Sparse Supervision Incentivizes Reasoning Ability

    Sep 7, 2026Zhishuai Liu, Xingzi Xu, Mehmet Saygin Seyfioglu +2Token-Level SupervisionSparse Supervision

  12. VERPO: Verified Evidence Regularized Policy Optimization

    Sep 5, 2026Haijiang Li, Chengyu Lv, Yi Zhang +8Reinforcement Learning With Verifiable RewardToken-Level Supervision

  13. Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents

    Aug 13, 2026Zechuan Wang, Siyuan Lu, Hongxuan Zhang +3Credit AssignmentReinforcement Learning With Verifiable Reward

  14. ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation

    Aug 11, 2026Ximo Zhu, Ruiqi Liu, Rong Wang +8Uni-OpdToken-Level Supervision

  15. MemOPD: On-Policy Distillation through Memory State Alignment for Long-Horizon Agents

    Aug 7, 2026Zhiyuan Liu, Tinghong Ye, Chenghao Liu +2Token-Level SupervisionLong-Horizon Task Planning

  16. Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation

    Aug 5, 2026Yi Yang, Cong Qin, Xiaodan Liu +8Unsupervised On-Policy Self-DistillationSelf-Distillation Framework

  17. TEXAS: Task-Expert-Aware Supervision for Downstream Mixture-of-Experts LLM Adaptation

    Jul 31, 2026Guanzhi Deng, Haibo Wang, Kuan Wu +5Token-Level Supervision

  18. FlowCTS: On-policy Continuous Trajectory Supervision of Flow Models

    Jul 27, 2026Kaiyang Ye, Yuan Ge, Junxiang Zhang +8Flow ModelsToken-Level Supervision

  19. Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift

    Jul 20, 2026Zitong Huang, Gustavo Lucas Carvalho, Deqing Fu +1Token-Level SupervisionToken-Level Uncertainty

  20. Consensus as Privileged Context for Label-Free Self-Distillation

    Jul 15, 2026John Gkountouras, Josip Jukić, Ivan TitovToken-Level SupervisionSelf-Distillation Framework

  21. LP-SFT: Local-Preserving Supervised Fine-Tuning via Multimodal Entropy Structure

    Jul 6, 2026Yueyang Wang, Baolong Bi, Shuo Lu +1Supervised FinetuningModel Fine-Tuning

  22. Regime-Aware Peer Specialization for Robust RAG under Heterogeneous Knowledge Conflicts

    Jun 29, 2026Bo Wang, Heyan Huang, Yaolin Li +5Token-Level SupervisionSearch-Augmented Reasoning

  23. SuperThoughts: Reasoning Tokens in Superposition

    Jun 11, 2026Zheyang Xiong, Shivam Garg, Max Yu +4Chain-of-Thought ReasoningThink

  24. RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation

    Jun 10, 2026Leyi Pan, Shuchang Tao, Yunpeng Zhai +5Unsupervised On-Policy Self-DistillationToken-Level Supervision

  25. Regret Pre-training: Bridging Prior and Posterior Views for Enhanced Knowledge Grounding

    Jun 2, 2026Mingkuan Zhao, Xiayu Sun, Wentao Hu +5Token-Level SupervisionCausal Attention

  26. Trust Region On-Policy Distillation

    May 31, 2026Xingrun Xing, Haoqing Wang, Boyan Gao +2Online-Policy DistillationToken-Level Supervision

  27. Inference-Free Multimodal Learned Sparse Retrieval for Production-Scale Visual Document Search

    May 29, 2026Gyu-Hwung Cho, Youngjune Lee, Kiyoon Jeong +5Visual Document RetrievalMultimodal Retrieval

  28. Distilling LLM Feedback for Lean Theorem Proving

    May 29, 2026Gaetan Narozniak, Gérard Biau, Rémi Munos +2Token-Level SupervisionTheorem Proving

  29. Not All Tokens Matter Equally: Dynamic In-context Vector Distillation with Decisive-Token Supervision for Long-form Medical Report Generation

    May 26, 2026Ning Wu, Rui Liu, Xinkun Lin +5Medical Report GenerationToken-Level Supervision

  30. Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation

    May 26, 2026Yuanyi Wang, Su Lu, Yanggan Gu +6Efficient On-Policy DistillationToken-Level Supervision

  31. DV-SFT: Direct Vision Supervision for Fine-Grained Visual Understanding

    May 26, 2026Jianfei Zhao, Feng Zhang, Xin Sun +3Long Visual-Token SequencesRecent Vision-Language Models

  32. NITP: Next Implicit Token Prediction for LLM Pre-training

    May 24, 2026Xiangdong Zhang, Debing Zhang, Shaofeng Zhang +3Next-Token PredictionToken-Level Supervision

  33. Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation

    May 12, 2026Yuwei Zhang, Sha Li, Changlong Yu +9Unsupervised On-Policy Self-DistillationReplay-Based Continual Learning

  34. Multi-Rollout On-Policy Distillation via Peer Successes and Failures

    May 12, 2026Weichen Yu, Xiaomin Li, Yizhou Zhao +8Token-Level SupervisionParallel Rollouts

  35. Where Does Long-Context Supervision Actually Go? Effective-Context Exposure Balancing

    May 11, 2026Jinchang Zhu, Jindong Li, Chengyu Zou +4Efficient Long-Context InferenceLarge Language Model Adaptation

  36. On-Policy Distillation with Best-of-N Teacher Rollout Selection

    May 10, 2026Ke Zhang, Yunjie Tian, Dongdi Zhao +4Online-Policy DistillationToken-Level Supervision

  37. MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate

    May 2, 2026Jianze Wang, Ying Liu, Jinlong Chen +7Aware Heterogeneous Multi-Teacher Multimodal On-Policy DistillationToken-Level Supervision

  38. Data Efficient Any Transformer-to-Mamba Distillation via Attention Bridge

    Oct 22, 2025Penghao Wang, Yuhao Zhou, Mengxuan Wu +3Hybrid Mamba-Transformer ModelDataset Distillation