Language Model Distillation

Latest papers 350

All topics
CardsList
  1. K2P: Label-Free Knowledge to Prompt Distillation

    Sep 30, 2026Yingchuan Zhang, Haoran Lu, Wenxuan Zhong +1Prompt LearningData-Free Knowledge Distillation

  2. Training LLM Judges from Language Feedback via Position-Selective Self-Distillation

    Sep 30, 2026Ilgee Hong, Changlong Yu, Zhenghao Xu +5LLM-as-a-JudgeLanguage Model Distillation

  3. On the Off-Policy Teacher in On-Policy Distillation

    Sep 29, 2026Langlin Huang, Hao Liu, Mononito Goswami +5Language Model DistillationOn-Policy Distillation

  4. Activation-Conditioned Self-Distillation

    Sep 29, 2026Zhexi Lu, Subhajit Chaudhury, Tejaswini Pedapati +2Numerical Reasoning in Language ModelsOn-Policy Self-Distillation

  5. Dr. OPD: Learning What to Follow for Optimal On-Policy Distillation of Large Language Models

    Sep 29, 2026Zhenyu Wang, Tianze Wang, Linjun Zhang +1Language Model DistillationBilevel Optimization

  6. From Dissonance to Orchestration: Teacher Intervention in On-Policy Distillation

    Sep 29, 2026Yuhao Wang, Ruiyang Ren, Yinan Zhang +3Language Model DistillationOn-Policy Distillation

  7. Beyond Prompt Count: How Data Shapes Transfer in On-Policy Distillation

    Sep 29, 2026Jiaxuan Wang, Jiafei Lyu, Yuchen Cai +8Training Data SelectionLanguage Model Distillation

  8. Interpolated Policy Distillation: A Controllable Continuum Between Off-Policy and On-Policy Distillation

    Sep 29, 2026Youxu Shi, Yifan Sun, Dacheng Yin +5Language Model DistillationOn-Policy Distillation

  9. Train Ahead, Distill Back: Bootstrapping On-Policy Self-Distillation for Large Language Models

    Sep 29, 2026Zheng Zhang, Xinyue Tan, Lufei Li +3On-Policy Self-DistillationLanguage Model Distillation

  10. Beyond Compression: Diagnosing How Post-Training Changes Mathematical Reasoning

    Sep 29, 2026Hongyang Li, Yiming Zhu, Xiao Li +3Language Model DistillationRL Post-Training

  11. Learning from Think-Mode Advantage via On-Policy Distillation

    Sep 29, 2026Wanqi Ren, Jianxiang Wang, Danxuan Liu +2CoT DistillationLanguage Model Distillation

  12. Beam Search as Test-Time Self-Distillation via Counterfactual Contexts

    Sep 29, 2026Su Ee Tan, Xiaotong Ji, Rasul Tutunov +2Language Model DistillationSelf-Distillation

  13. Know Thyself, Teach Thyself: Internal Information Flow for Selective Self-Distillation

    Sep 29, 2026Rui Wang, Ruijie Wang, Bo Chen +2On-Policy Self-DistillationSelective Knowledge Distillation

  14. SAKI: Maximal-Coupling-Routed Teacher Supervision for On-Policy Distillation

    Sep 29, 2026Miteto Wei, Xiaohan Wang, Zehao Chen +7Language Model DistillationOn-Policy Distillation

  15. Interactive-Policy Distillation with Bidirectional Propose-and-Verify

    Sep 29, 2026Shutong Wu, Xiwen Chen, Brendan Rappazzo +4Language Model DistillationOn-Policy Distillation

  16. Learning from Teacher Continuations at Student States

    Sep 28, 2026Haojin Wang, Dylan Zhang, Huaibo Chen +8Language Model DistillationOn-Policy Distillation

  17. Distillation Defenses Easily Break After Reinforcement Learning

    Sep 28, 2026Shidan Javaheri, Alexander Panfilov, Oliver Britton +2LLM SecurityLanguage Model Distillation

  18. Reward-Aligned Reweighting for On-Policy Distillation

    Sep 28, 2026Haofeng Xu, Junwei Su, Lansong Diao +2Language Model DistillationOn-Policy Distillation

  19. An RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning

    Sep 28, 2026Shangzhe Li, Yuxiao Yang, Tianrun Yu +4RL for Language Model ReasoningLanguage Model Distillation

  20. Inductive Feedback for Mixed-Policy Distillation

    Sep 28, 2026Amir Moeini, Huaijiang Zhu, Daniel Havir +1Language Model DistillationOn-Policy Distillation

  21. Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation

    Sep 28, 2026Xin Li, Hao Jiang, Xin Gao +6Language Model DistillationMulti-Teacher Knowledge Distillation

  22. Teacher-Student Gaps Are Not Enough: Outcome-Guided On-Policy Distillation for Multi-Turn Autonomous Agents

    Sep 28, 2026Tong Zhang, Zhou Liu, Yihao Liu +8Language Model DistillationOn-Policy Distillation

  23. On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics

    Sep 28, 2026Julianna Piskorz, Antonin Berthon, Mihaela van der SchaarLanguage Model DistillationOn-Policy Distillation

  24. Unbiased Top-kk Estimation for On-Policy Distillation

    Sep 28, 2026Linjian Meng, Siyuan Gan, YuHan Li +5Language Model DistillationOn-Policy Distillation

  25. Look Before You Select: Rethinking Vocabulary Sparsification in On-Policy Distillation

    Sep 28, 2026Yongliang Miao, Shuang Liu, Yanguang Liu +2Language Model DistillationOn-Policy Distillation

  26. DreamingGoose: Staged Distillation from Autoregressive Transformers to Bidirectional Recurrent Diffusion Language Models

    Sep 28, 2026Julian Boesch, Andrew Wee, Alexander StranzlIn-Context RetrievalRecurrent Transformers

  27. Dual-Vocabulary Language Model for Cross-Tokenizer Distillation

    Sep 27, 2026Kedi Chen, Chen Lin, Yutao Sun +1Cross-Tokenizer Knowledge DistillationLanguage Model Distillation

  28. Do We Really Need KL Divergence for On-Policy Distillation of Large Language Models?

    Sep 27, 2026Wenze Lin, Jiyuan Long, Jiale Zhao +11Data-Free Knowledge DistillationLanguage Model Distillation