On-Policy Self-Distillation

Momentum

30 papers in the last four weeks, up 233% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 108

All topics
CardsList
  1. When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning

    May 20, 2026Xiaogeng Liu, Xinyan Wang, Yingzi Ma +2CoT DistillationOn-Policy Self-Distillation

  2. AVSD: Adaptive-View Self-Distillation by Balancing Consensus and Teacher-Specific Privileged Signals

    May 20, 2026Duy Nguyen, Hanqi Xiao, Archiki Prasad +7On-Policy Self-DistillationLanguage Model Distillation

  3. Reducing the Safety Tax in LLM Safety Alignment with On-Policy Self-Distillation

    May 14, 2026Yu Fu, Longxuan Yu, Haz Sameen Shahgir +4LLM AlignmentOn-Policy Self-Distillation

  4. Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning

    May 13, 2026Junlong Ke, Zichen Wen, Weijia Li +2On-Policy Self-DistillationRL for Language Model Reasoning

  5. From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation

    May 12, 2026Guobin Shen, Lei Huang, Xiang Cheng +4Reinforcement LearningOn-Policy Self-Distillation

  6. Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information

    May 12, 2026Guobin Shen, Xiang Cheng, Chenxiao Zhao +4On-Policy Self-DistillationRL for Language Model Reasoning

  7. The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes

    May 11, 2026Siqi Zhu, Xuyan Ye, Hongyu Lu +2On-Policy Self-DistillationOn-Policy Distillation

  8. STEPS: Selective On-Policy Self-Distillation for Reasoning

    May 11, 2026Jiaxuan Wang, Xuan Ouyang, Zhiyu Chen +2On-Policy Self-DistillationRL for Language Model Reasoning

  9. Crosslingual On-Policy Self-Distillation for Multilingual Reasoning

    May 10, 2026Yihong Liu, Raoyuan Zhao, Michael A. Hedderich +1On-Policy Self-DistillationCross-Lingual Reasoning in Language Models

  10. D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models

    May 6, 2026Dengyang Jiang, Xin Jin, Dongyang Liu +9Supervised Fine-TuningDiffusion Model Distillation

  11. Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization

    May 6, 2026Xin Yu, Liuchen Liao, Yiwen Zhang +3On-Policy Self-DistillationLanguage Model Distillation