Language Model Distillation

Latest papers 350

All topics
CardsList
  1. A Statistical Perspective on Knowledge Distillation: Foundations, Classical Methods, and Large Language Model Extensions

    Sep 27, 2026Luyang Fang, Haoran Lu, Jiazhang Cai +4Language Model DistillationKnowledge Distillation

  2. DuoOPD: Learning from Joint Teacher-Student Outcomes for Multi-Task On-Policy Distillation

    Sep 27, 2026Ao Yu, Weibo Gao, Heng Zhou +6Language Model DistillationOn-Policy Distillation

  3. TeacherGRPO: Closing the Capacity Gap in Reasoning Distillation via Teacher Alignment

    Sep 27, 2026Zhenyu Lei, Zihan Chen, Yaochen Zhu +5Reasoning DistillationRL for Language Model Reasoning

  4. Calibration, Not Answer Selection: Distilling Internal Confidence in Reasoning Models

    Sep 27, 2026Yadong Xi, Rongsheng Zhang, Tangjie Lv +2Confidence Estimation in Language ModelsLanguage Model Calibration

  5. Train4Merge: A Controlled Single-Teacher Study of RL vs. SFT Teachers for OPD-Based Model Merging

    Sep 26, 2026Jingyuan Huang, Zuming Huang, Yucheng Shi +4Language Model MergingLanguage Model Distillation

  6. Post-Training Leaves Behavioral Shadows on Unrelated Decisions

    Sep 24, 2026Ziyang Zhang, Yubin Jing, Yuanhao Zeng +3Subliminal LearningLanguage Model Distillation

  7. LastOPD: Taming Collapse in Latent On-Policy Distillation

    Sep 23, 2026Jie Yang, Zhengyu Fang, Zelin Xu +7Language Model DistillationOn-Policy Distillation

  8. Reward-Tilted On-Policy Distillation for Acoustic Grounding in Audio-Language Models

    Sep 23, 2026Kaiyang Li, Shaobo Han, Yue Tian +1Audio-Language ModelsLanguage Model Distillation

  9. iSDFT: Information-Proximal Self-Distillation for Continual Learning in LLMs

    Sep 21, 2026Ahmed Khaled Khamis, Xiaotong Ji, Hassan Jaber +4Continual Learning for LLMsLanguage Model Distillation

  10. Efficient LLM Distillation for Bangladesh Legal Context: A Smartphone-Compatible Retrieval-Augmented Generation Model

    Sep 21, 2026MD. Nafis Kamal, Mahadi Hasan Fahim, Talha Ridwan +4Retrieval-Augmented GenerationLegal NLP

  11. Distill What You Trust: Reliability-Aware Multi-Teacher On-Policy Distillation

    Sep 20, 2026Jie Sun, Mao Zheng, Mingyang Song +8Language Model DistillationMulti-Teacher Knowledge Distillation

  12. When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation

    Sep 17, 2026Yuxiao Yang, Tianrun Yu, Shangzhe Li +6Language Model DistillationOn-Policy Distillation

  13. Beyond Token-Local Imitation: Reward-Compatible Temporal Credit Assignment for On-Policy Distillation

    Sep 15, 2026Shiqi Liu, Zeyu He, Letian Tao +9RL for Language Model ReasoningTemporal Credit Assignment

  14. Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models

    Sep 14, 2026Kalyani Marathe, Artidoro Pagnoni, Tomasz Limisiewicz +4Decoder-Only Language ModelsLanguage Model Scaling Laws

  15. SCOPE-OPSD: Fisher-Conditioned Privileged Subspaces for On-Policy Self-Distillation

    Sep 14, 2026Yunmeng Chen (Chongqing Ant Consumer Finance Co., Ltd), Kunyu Wang (Alibaba Cloud Computing Co. +18On-Policy Self-DistillationLanguage Model Distillation

  16. Negative Self-Distillation: Learning to Reason by Avoiding Flaws

    Sep 10, 2026Rongcan Pei, Zhepei Wei, Shuyao Xu +3Language Model DistillationSelf-Distillation

  17. CompassOPD: Cross-Family On-Policy Distillation via Within-Family Likelihood Shifts

    Sep 9, 2026Naibin Gu, Qingyi Si, Chenxu Yang +5Language Model DistillationOn-Policy Distillation

  18. VERPO: Verified Evidence Regularized Policy Optimization

    Sep 5, 2026Haijiang Li, Chengyu Lv, Yi Zhang +8RL for Language Model ReasoningCredit Assignment in RL