On-Policy Self-Distillation

Momentum

30 papers in the last four weeks, up 233% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 108

All topics
CardsList
  1. Teach Yourself Where to Look: On-Policy Attention Self-Distillation for Reasoning

    Sep 27, 2026Safaeid Hossain Arib, Rabeya Akter, Ismam Nur Swapnil +3Numerical Reasoning in Language ModelsOn-Policy Self-Distillation

  2. From Self-Distillation to Self-Practice: Privileged Information for Multi-Turn Agents

    Sep 24, 2026Xingyu Su, Abhishek Kumar, Qing Ping +5On-Policy Self-DistillationLLM Agent Training

  3. What Should a Self-Teacher See? Privileged Context Design for On-Policy Self-Distillation

    Sep 22, 2026Kanghui Tian, Siyuan Liu, Tianxiang Jiang +8On-Policy Self-DistillationContext Distillation

  4. SCOPE-OPSD: Fisher-Conditioned Privileged Subspaces for On-Policy Self-Distillation

    Sep 14, 2026Yunmeng Chen (Chongqing Ant Consumer Finance Co., Ltd), Kunyu Wang (Alibaba Cloud Computing Co. +18On-Policy Self-DistillationLanguage Model Distillation

  5. Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

    Aug 27, 2026Shiyi Zhang, Mushui Liu, Yunze Tong +8Flow MatchingOn-Policy Self-Distillation

  6. Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding

    Aug 26, 2026Kaishen Wang, Dongdi Zhao, Yijun Liang +4On-Policy Self-DistillationVLM Distillation

  7. Latent On-Policy Self-Distillation

    Aug 13, 2026Guibin Zhang, Jiayang Lyu, Ran Sun +4On-Policy Self-DistillationKnowledge Distillation

  8. I-SDPO: Instance-Level Adaptive Self-Distillation Policy Optimization

    Aug 13, 2026Yubo Zhang, Xinhong Ma, Zezhong Tan +1On-Policy Self-DistillationGroup Relative Policy Optimization

  9. Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation

    Aug 11, 2026Shiyu Xuan, Zechao LiTest-Time AdaptationOn-Policy Self-Distillation

  10. Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation

    Aug 10, 2026Yubo Jiang, Fengying Xie, Zhiguo Jiang +1On-Policy Self-DistillationRL for Language Model Reasoning

  11. SR-OPSD: Self-Referenced On-Policy Self-Distillation

    Aug 10, 2026Zhuo Sun, Entong Li, Yanlong Zhao +9On-Policy Self-DistillationLanguage Model Distillation

  12. Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation

    Aug 10, 2026Yuki Ichihara, Naoto Iwase, Mohammad Atif Quamar +1On-Policy Self-DistillationLanguage Model Distillation

  13. PAST: Privileged Adaptation from Complete Student Trajectories for On-Policy Self-Distillation

    Aug 9, 2026Yangyang Feng, Zhuoyan Feng, Junlan ChenOn-Policy Self-DistillationKnowledge Distillation

  14. Matching Supervision to the Student's Learning Capacity: A Unified Framework for On-Policy Self-Distillation

    Aug 8, 2026Yongkang Yang, Zhezheng Hao, Hong Zhang +8On-Policy Self-DistillationLanguage Model Distillation

  15. Adaptive Supervised Anchoring for On-Policy Self-Distillation

    Aug 8, 2026Meilin Yang, Zixuan Ding, Jianhao Nie +5Supervised Fine-TuningOn-Policy Self-Distillation

  16. RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer

    Aug 6, 2026Xinye Wang, Junxiao Liu, Shujian HuangNumerical Reasoning in Language ModelsMultilingual Language Models

  17. On-Policy Self-Distillation without Any Supervision

    Aug 6, 2026Yijiang Li, Bingyang Wang, Yijun Liang +3On-Policy Self-DistillationLanguage Model Self-Improvement

  18. DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

    Aug 6, 2026ZhiYan Hou, Xinyu Tang, Hongyan An +9On-Policy Self-DistillationRL for Language Model Reasoning

  19. OPD-V: Visual On-Policy Self-Distillation with Modality Balance

    Aug 5, 2026Aniri, Jinhe Bi, Peng Liao +5Modality ImbalanceOn-Policy Self-Distillation

  20. TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning

    Aug 4, 2026Changle Qu, Sunhao Dai, Hengyi Cai +4On-Policy Self-DistillationRL for Language Model Reasoning

  21. DAPD: Dual-Anchored Policy Distillation

    Aug 3, 2026Jianyu Wu, Yizhou Wang, Encheng Su +2On-Policy Self-DistillationLanguage Model Distillation

  22. Is More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled Reasoning

    Aug 3, 2026Xuyang Zhao, Liting Zhang, Zichen Xu +4On-Policy Self-DistillationKnowledge Representation

  23. ββ-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

    Jul 30, 2026Jiawei Xu, Minghui Liu, Juzheng Zhang +2KL-Regularized RLOn-Policy Self-Distillation

  24. Self-Boosting Vision-Language Models with Noisy Student On-Policy Self-Distillation

    Jul 25, 2026Shuai Wang, Daoan Zhang, Zhe Tang +2VLM AdaptationOn-Policy Self-Distillation

  25. Visual Contrastive Self-Distillation

    Jul 23, 2026Yijun Liang, Yunjie Tian, Yijiang Li +4On-Policy Self-DistillationVLM Distillation

  26. Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?

    Jul 20, 2026Fan Yang, Rui Meng, Yuxin WenAgentic SearchOn-Policy Self-Distillation

  27. Diagnosing and Mitigating Thinking Collapse in On-Policy Self-Distillation

    Jul 12, 2026Keqin Peng, Chen Li, Yuanxin Ouyang +2On-Policy Self-DistillationLLM Reasoning

  28. OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators

    Jul 9, 2026Hongyu Liu, Chun Wang, Feng Gao +6Video Diffusion ModelsAutoregressive Diffusion