Language Model Distillation

Latest papers 350

All topics
CardsList
  1. Distilling Safe LLM Systems via Soft Prompts for On Device Settings

    Jun 8, 2026Motasem Alfarra, Cristina Pinneri, Dana Kianfar +2On-Device Language Model InferenceLLM Safety Alignment

  2. SG-OPD: Sign-Gated On-Policy Distillation via Sign-Consistency Gating and Phased Teacher Sampling

    Jun 8, 2026Haoran Xu, Hongyu Wang, Yifei Gao +3Language Model DistillationOn-Policy Distillation

  3. From Hazard Functions to Language Space: Cox-Supervised Distillation of Survival Risk into a Large Language Model

    Jun 8, 2026Nicholas I-Hsien Kuo, Blanca Gallego, Louisa JormSurvival AnalysisLanguage Model Calibration

  4. On the Geometry of On-Policy Distillation

    Jun 5, 2026Zhennan Shen, Yanshu Li, Qingyu Yin +6Language Model DistillationOn-Policy Distillation

  5. Data-Efficient Autoregressive-to-Diffusion Language Models via On-Policy Distillation

    Jun 4, 2026Xingyu Su, Jacob Helwig, Shubham Parashar +6Autoregressive DiffusionLanguage Model Distillation

  6. OPRD: On-Policy Representation Distillation

    Jun 4, 2026Shenzhi Yang, Guangcheng Zhu, Bowen Song +8Cross-Architecture Knowledge DistillationLanguage Model Distillation

  7. LoRi: Low-Rank Distillation for Implicit Reasoning

    Jun 3, 2026Ryan Solgi, Jiayi Tian, Zheng ZhangCoT DistillationMathematical Reasoning

  8. DuDi: Dual-Signal Distillation with Cross-Lingual Verbalizer

    Jun 3, 2026Patomporn Payoungkhamdee, Tinnakit Udsa, Jian Gang Ngui +3Multilingual Language ModelsSmall Language Models

  9. When Should the Teacher Move? Temporal Coupling and Stability in Self On-Policy Distillation

    Jun 2, 2026Haowei Guo, Baolong Bi, Ruicheng Zhang +2On-Policy Self-DistillationLanguage Model Distillation

  10. Constitutional On-Policy Safe Distillation

    Jun 2, 2026Ming Wen, Yuxuan Liu, Kun Yang +8On-Policy Self-DistillationLLM Safety Alignment

  11. Regret Pre-training: Bridging Prior and Posterior Views for Enhanced Knowledge Grounding

    Jun 2, 2026Mingkuan Zhao, Xiayu Sun, Wentao Hu +5Language Model PretrainingLLM Grounding

  12. Trust Region On-Policy Distillation

    May 31, 2026Xingrun Xing, Haoqing Wang, Boyan Gao +2Language Model DistillationTrust-Region Optimization

  13. OPD+: Rethinking the Advantage Design for On-Policy Distillation

    May 31, 2026Hanyang Zhao, Haoxian Chen, Han Lin +3Language Model DistillationPolicy Gradient Methods

  14. Subliminal Learning Is Steering Vector Distillation

    May 31, 2026Camila Blank, Agam Bhatia, Senthooran Rajamanoharan +2Language Model SteeringSubliminal Learning

  15. Robust Reasoning via Dynamic Token Selection for Distribution-Aligned Self-Distillation

    May 30, 2026Ruiqi Zhang, Lingxiang Wang, Hainan Zhang Zhiming ZhengLanguage Model DistillationLanguage Model Robustness

  16. Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight

    May 29, 2026Can Jin, Jiakang Li, Rui Wu +2Scalable OversightWeak-to-Strong Generalization

  17. Rethinking the Role of Temperature in Large Language Model Distillation

    May 29, 2026Hoang-Chau Luong, Lingwei ChenLanguage Model DistillationKnowledge Distillation

  18. Are Full Rollouts Necessary for On-Policy Distillation?

    May 29, 2026Yaocheng Zhang, Jiajun Chai, Yuqian Fu +7RL for Language Model ReasoningLanguage Model Distillation

  19. Trust-Region Behavior Blending for On-Policy Distillation

    May 29, 2026Daniil Plyusov, Alexey Gorbatovski, Alexey Malakhov +4Language Model DistillationTrust-Region Optimization

  20. Distilling LLM Feedback for Lean Theorem Proving

    May 29, 2026Gaetan Narozniak, Gérard Biau, Rémi Munos +2RL for Language Model ReasoningMathematical Reasoning

  21. Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation

    May 29, 2026Yanjiang Liu, Jie Lou, Xinyan Guan +7CoT DistillationLanguage Model Distillation

  22. LARK: Learnability-Grounded Trajectory Selection for Efficient Reasoning Distillation

    May 28, 2026Tianrun Yu, Kaixiang Zhao, Chih-Chun Chen +5CoT DistillationLanguage Model Distillation

  23. Speculative Decoding Across Languages

    May 28, 2026Nirajan Paudel, Michael Ginn, Luc De Nardi +1Multilingual Language ModelsSpeculative Decoding

  24. Bounded Behavioral Indistinguishability for Black-Box LLM Distillation

    May 28, 2026Munawar HasanLLM EvaluationLanguage Model Distillation

  25. Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models

    May 28, 2026Zizhuo Lin, Quanling Liu, Jinsheng Quan +6LLM GroundingReasoning Consistency in Language Models

  26. Draft-OPD: On-Policy Distillation for Speculative Draft Models

    May 28, 2026Haodi Lei, Yafu Li, Haoran Zhang +8Speculative DecodingLLM Inference Acceleration