On-Policy Self-Distillation

Momentum

30 papers in the last four weeks, up 233% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 108

All topics
CardsList
  1. Geometric Self-Distillation for Reasoning Generalization

    Jul 7, 2026Josip Jukić, Ivan TitovOn-Policy Self-DistillationOOD Generalization

  2. Rethinking On-Policy Self-Distillation for Thinking Models

    Jul 6, 2026Simran Kaur, Narutatsu Ri, Yinghui He +2LLM Self-CorrectionOn-Policy Self-Distillation

  3. dOPSD: On-Policy Self-Distillation for Diffusion Language Models

    Jul 5, 2026Phuong Tuan Dat, Qi Li, Xinchao WangOn-Policy Self-DistillationLanguage Model Distillation

  4. DemoPSD: Disagreement-Modulated Policy Self-Distillation

    Jul 2, 2026Yunhe Li, Hao Shi, Wenhao Liu +5On-Policy Self-DistillationRL for Language Model Reasoning

  5. Neuron-Aware Data Selection for Annotation-Free LLM Self-Distillation

    Jul 2, 2026Zhuowei Chen, Xiang Lorraine LiOn-Policy Self-DistillationTraining Data Selection

  6. Purified OPSD: On-Policy Self-Distillation Without Losing How to Think

    Jul 2, 2026Zhanming Shen, Jintao Tong, Shaotian Yan +9CoT DistillationOn-Policy Self-Distillation

  7. Denser ≠\neq Better: Limits of On-Policy Self-Distillation for Continual Post-Training

    Jul 2, 2026Meng Wang, Haohan Zhao, Wenzhuo Liu +7Continual Learning for LLMsOn-Policy Self-Distillation

  8. DOPD: Dual On-policy Distillation

    Jun 29, 2026Xinlei Yu, Gen Li, Qingyi Si +13On-Policy Self-DistillationVLM Distillation

  9. PHF: Privileged Hidden Flow for On-Policy Self-Distillation

    Jun 28, 2026Yuhan Li, Mingxu Zhang, Dazhong Shen +1On-Policy Self-DistillationLanguage Model Distillation

  10. On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity

    Jun 24, 2026Andrei Liviu Nicolicioiu, Mohammad Pezeshki, Aaron CourvilleOn-Policy Self-DistillationLanguage Model Distillation

  11. Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation

    Jun 17, 2026Sihan Wang, Xiyao Liu, Lianqing Liu +1Vision-Language ModelsOn-Policy Self-Distillation

  12. Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

    Jun 17, 2026Pengyu Li, Zhitao Gao, Lingling Zhang +5Cross-Modal Knowledge DistillationEfficient Multimodal Inference

  13. Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation

    Jun 17, 2026Zhilin Huang, Hang Gao, Ziqiang Dong +6LLM Self-CorrectionCoT Distillation

  14. Learning from the Self-future: On-policy Self-distillation for dLLMs

    Jun 16, 2026Yifu Luo, Zeyu Chen, Haoyu Wang +4On-Policy Self-DistillationDiffusion Language Models

  15. Trust the Right Teacher: Quality-Aware Self-Distillation for GUI Grounding

    Jun 16, 2026Jingyuan Huang, Zuming Huang, Yucheng Shi +4On-Policy Self-DistillationGUI Grounding

  16. OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

    Jun 14, 2026Zebang Cheng, Shuimu Chen, Boxue Yang +7On-Policy Self-DistillationMultimodal Large Language Models

  17. ParaBridge: Bridging Paralinguistic Perception and Dialogue Behavior in Speech Language Models

    Jun 9, 2026Yuxiang Wang, Qinke Ni, Shengbo Cai +3On-Policy Self-DistillationSpoken Dialogue Systems

  18. Thinking Without Images: Internalizing Visual Manipulation with On-Policy Self-Distillation

    Jun 7, 2026Yishuo Cai, Jiahui Liu, Yuanxin Liu +9Tool Use in VLMsEfficient VLM Inference

  19. Physics-Guided Policy Optimization with Self-Distillation

    Jun 2, 2026Ke Wang, Yuning Wu, Haoran Liu +3On-Policy Self-DistillationPolicy Optimization

  20. World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning

    Jun 2, 2026Yucheng Zhou, Wei Tao, Yiwen Guo +1On-Policy Self-DistillationWorld Models

  21. When Should the Teacher Move? Temporal Coupling and Stability in Self On-Policy Distillation

    Jun 2, 2026Haowei Guo, Baolong Bi, Ruicheng Zhang +2On-Policy Self-DistillationLanguage Model Distillation

  22. Constitutional On-Policy Safe Distillation

    Jun 2, 2026Ming Wen, Yuxuan Liu, Kun Yang +8On-Policy Self-DistillationLLM Safety Alignment

  23. Self-Distilled Policy Gradient

    Jun 2, 2026Yifeng Liu, Shiyuan Zhang, Yifan Zhang +1Policy GradientOn-Policy Self-Distillation

  24. A Predictive Law for On-Policy Self-Distillation From World Feedback

    May 28, 2026Tommy He, Jerome Sieber, Matteo SaponatiOn-Policy Self-DistillationRL Post-Training

  25. Beyond Imitation: Reflective On-Policy Self-Distillation for LLM Reasoning

    May 27, 2026Ziqi Zhao, Xinyu Ma, Liu Yang +6On-Policy Self-DistillationLanguage Model Distillation

  26. Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning

    May 26, 2026Zehao Liu, Yuanpu Cao, Jinghui Chen +1Reinforcement LearningOn-Policy Self-Distillation

  27. Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning

    May 21, 2026Hongbin Zhang, Chaozheng Wang, Kehai Chen +4On-Policy Self-DistillationMathematical Reasoning