Language Model Distillation

Latest papers 350

All topics
CardsList
  1. SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation

    Aug 5, 2026Zikun Qu, Min Zhang, Mingze Kong +4Language Model DistillationOn-Policy Distillation

  2. When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation

    Aug 4, 2026Yinuo Jiang, Yongjie Ye, Zhou Tao +4VLM DistillationLanguage Model Distillation

  3. PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning

    Aug 3, 2026Chunji Lv, Yangguang Wei, Junlin Liu +6Language Model DistillationOn-Policy Distillation

  4. DAPD: Dual-Anchored Policy Distillation

    Aug 3, 2026Jianyu Wu, Yizhou Wang, Encheng Su +2On-Policy Self-DistillationLanguage Model Distillation

  5. Native Multilingual Chain-of-Thought Reasoning in Low-Resource Southeast Asian Languages

    Aug 1, 2026Sean Gip Lim, William Chandra Tjhi, Hai Leong ChieuNumerical Reasoning in Language ModelsMultilingual Language Models

  6. Adaptive FastOPD: Progress-Aware Rollout Horizon Expansion for Efficient On-Policy Distillation

    Jul 31, 2026Qian Tan, Huaifei Liang, Xuanyu Zhu +2Language Model DistillationOn-Policy Distillation

  7. Distilling Knowledge from Large Language Models into Lightweight Reinforcement Learning Agents for Autonomous Cyber Operations

    Jul 30, 2026Konur Tholl, François Rivest, Mariam El Mezouar +2Autonomous Cyber DefenseLLM-Guided RL

  8. ββ-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

    Jul 30, 2026Jiawei Xu, Minghui Liu, Juzheng Zhang +2KL-Regularized RLOn-Policy Self-Distillation

  9. Flux-OPD: On-Policy Distillation with Evolving Contexts

    Jul 30, 2026Yuran Wang, Zekun Wang, Bohan Zeng +10Language Model DistillationOn-Policy Distillation

  10. Weak-to-Strong On-Policy Distillation

    Jul 28, 2026Fangxu Yu, Weijia Xu, Michael Xu +2Language Model DistillationOn-Policy Distillation

  11. Pass the Baton: Trajectory-Relayed On-Policy Distillation

    Jul 28, 2026Haolei Xu, Xiaowen Xu, Haiwen Hong +5Language Model DistillationOn-Policy Distillation

  12. Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization

    Jul 24, 2026Hao Wang, Kun Yuan, Wenlin Zhong +4Cross-Tokenizer Knowledge DistillationLLM Compression

  13. Sample-Efficient Learning from Agent Experience

    Jul 23, 2026Chenhui Gou, Haoqin Tu, Yunhao Fang +2In-Context RLLanguage Model Distillation

  14. REGEN: Replay-recycling for Expert-to-Generalist distillation with Offline Reinforcement Learning

    Jul 21, 2026Yunjie Chen, Xiaoxin Chen, Fang WangRL for Language ModelsRL for Language Model Reasoning

  15. Contrastive On-Policy Distillation

    Jul 21, 2026Jiacheng Ruan, Jun Tang, Wenzhen Yuan +5Language Model DistillationOn-Policy Distillation

  16. H2^2SD: Hybrid Hindsight Self-Distillation

    Jul 21, 2026Qiye Cai, Yichuan Ma, Peiji Li +6RL for Language Model ReasoningLanguage Model Distillation

  17. Rationale-Guided Knowledge Distillation for Cross-Lingual Stance Detection

    Jul 21, 2026Qiuli Zhou, Jingyuan Yao, Shengeng Tang +3Stance DetectionLanguage Model Distillation

  18. Trace-Based On-Policy Distillation for Masked Diffusion Language Models

    Jul 18, 2026Haolin Ren, Ziyang Huang, Chenhao Yuan +2Masked Diffusion ModelsDiffusion Model Distillation

  19. On-Policy Delta Distillation

    Jul 16, 2026Byeongho Heo, Jaehui Hwang, Sangdoo Yun +1RL for Language Model ReasoningLanguage Model Distillation

  20. Gold-Guided Programmatic Distillation for Financial Reasoning over Hybrid Tables and Text

    Jul 16, 2026Yun Dong, Erica Zhao, Elana ChenTable QAFinancial QA

  21. Answer-Conditioned Chains of Thought Degrade Verifiable-Reasoning Distillation in Large Language Models

    Jul 16, 2026Jungseob Lee, Seungyoon Lee, Suhyune Son +4CoT DistillationLanguage Model Distillation

  22. Consensus as Privileged Context for Label-Free Self-Distillation

    Jul 15, 2026John Gkountouras, Josip Jukić, Ivan TitovSelf-Training for Language ModelsLanguage Model Distillation