Language Model Distillation

Latest papers 350

All topics
CardsList
  1. Improving Reasoning Capabilities in Small Models through Mixture-of-Layers Distillation with Stepwise Attention on Key Information

    Apr 17, 2026Yao Chen, Jiawei Sheng, Wenyuan Zhang +1CoT DistillationSmall Language Models

  2. Subliminal Transfer of Unsafe Behaviors in AI Agent Distillation

    Apr 16, 2026Jacob Dang, Brian Y. Xie, Omar G. YounisSubliminal LearningLanguage Model Distillation

  3. When Perplexity Lies: Generation-Focused Distillation of Hybrid Sequence Models

    Mar 27, 2026Juan Gabriel Kostelec, Qinghai GuoLLM Inference EfficiencyLLM Evaluation

  4. Grounded Chess Reasoning in Language Models via Master Distillation

    Mar 20, 2026Zhenwei Tang, Qianfeng Wen, Seth Grief-Albert +4LLM GroundingCoT Distillation

  5. Effective Distillation to Hybrid xLSTM Architectures

    Mar 16, 2026Lukas Hauzenberger, Niklas Schmidinger, Thomas Schmied +7LLM CompressionLanguage Model Distillation

  6. HEAL: Hindsight Entropy-Assisted Learning for Reasoning Distillation

    Mar 11, 2026Wenjing Zhang, Jiangze Yan, Jieyun Huang +7CoT DistillationLanguage Model Distillation

  7. KDFlow: A User-Friendly and Efficient Knowledge Distillation Framework for Large Language Models

    Mar 2, 2026Songming Zhang, Xue Zhang, Tong Zhang +3Cross-Tokenizer Knowledge DistillationLanguage Model Distillation

  8. Semantic Self-Distillation for Language Model Uncertainty

    Feb 4, 2026Edward Phillips, Sean Wu, Fredrik K. Gustafsson +2Uncertainty QuantificationConfidence Estimation in Language Models

  9. Distilling LLM Reasoning into Graph of Concept Predictors

    Feb 3, 2026Ziyang Yu, Liang ZhaoCoT DistillationActive Learning

  10. Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models

    Feb 2, 2026Hao Wang, Hao Gu, Hongming Piao +6Supervised Fine-TuningLanguage Model Distillation

  11. Distilling Token-Trained Models into Byte-Level Models

    Feb 1, 2026Zishuo Bao, Jiaqi Leng, Junxiong Wang +2LLM Fine-TuningByte-Level Language Model

  12. OVD: On-policy Verbal Distillation

    Jan 29, 2026Jing Xiong, Hui Shen, Shansan Gong +7Language Model DistillationOn-Policy Distillation

  13. Find Your Optimal Teacher: Personalized Data Synthesis via Router-Guided Multi-Teacher Distillation

    Oct 13, 2025Hengyuan Zhang, Shiping Yang, Xiao Liang +8Synthetic Data GenerationLanguage Model Distillation

  14. Base Models Know How to Reason, Thinking Models Learn When

    Oct 8, 2025Constantin Venhoff, Iván Arcuschin, Philip Torr +2LLM InterpretabilityRL for Language Model Reasoning

  15. Scale or Reason? A Compute-Equivalent Analysis of Reasoning Distillation

    Sep 26, 2025Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Kevin El Haddad +2CoT DistillationLLM Fine-Tuning

  16. Beyond Scaling Law: A Data-Efficient Distillation Framework for Reasoning

    Aug 13, 2025Xiaojun Wu, Xiaoguang Jiang, Huiyang Li +11CoT DistillationLanguage Model Distillation

  17. A Token is Worth over 1,000 Tokens: Efficient Knowledge Distillation through Low-Rank Clone

    May 19, 2025Jitai Hao, Qiang Huang, Hao Liu +3Language Model PretrainingLLM Pruning