Residual Distillation

Latest papers 35

All topics
CardsList
  1. Smaller Models, Better Rejects: Preference Distillation Scaling

    Sep 30, 2026Rui Cai, Wenhui Zhu, Xiwen Chen +15Small Reasoning ModelResidual Distillation

  2. When Sparse Reward Meets Dense Distillation: Training Dynamics of On-Policy Distillation

    Sep 28, 2026Xinke Jiang, Tao Feng, Zhibang Yang +4Residual Distillation

  3. Do We Really Need KL Divergence for On-Policy Distillation of Large Language Models?

    Sep 27, 2026Wenze Lin, Jiyuan Long, Jiale Zhao +11Kullback-Leibler DivergenceResidual Distillation

  4. A Statistical Perspective on Knowledge Distillation: Foundations, Classical Methods, and Large Language Model Extensions

    Sep 27, 2026Luyang Fang, Haoran Lu, Jiazhang Cai +4Knowledge DistillationResidual Distillation

  5. Robust Decentralized Federated Distillation via Multi-Modality Knowledge Collaboration

    Sep 7, 2026Xiao Ma, Hong Shen, Hui Tian +2Byzantine AttacksResidual Distillation

  6. Matryoshka Language Model Suites

    Aug 10, 2026Nathan Godey, Yoav ArtziLanguage ModelingMatryoshka Representation Learning

  7. When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills

    Aug 4, 2026Yongli Xiang, Zhifang Zhang, Bojun Yang +4Persona ConsistencyPrivacy

  8. AS-FedBridge: Pseudo-Spike Bridge Distillation for Heterogeneous ANN-SNN Federated Learning

    Aug 4, 2026Shengyang Li, Yiting Dong, Liuyang Song +5Spiking Neural NetworksFederated Learning

  9. Outcome-Guided Distillation: A Teacher-Student Framework to Advance VLM Reasoning in Autonomous Driving

    Jul 31, 2026Zeyu Dong, Yimin Zhu, Yu Wu +1Autonomous DrivingWaypoints

  10. LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

    Jul 29, 2026Rongxiang Zhang, Songhua LiuPrecise Lip SynchronizationTalk

  11. Geometric Distillation from Rectified Stereo: Leveraging Epipolar Cues for Monocular Depth

    Jul 17, 2026Jung-Hee Kim, Xiaoming LiuMonocular Depth EstimationScale-Ambiguous Epipolar Geometry

  12. Domain-Incremental Remote Sensing Change Detection via Difference-Guided Adaptation and Frequency-Decoupled Distillation

    Jul 14, 2026Daifeng Peng, Yaning Li, Haiyan GuanChange DetectionClass-Incremental Learning

  13. Understanding Layer Patching in Model Size Interpolation

    Jul 9, 2026Sara Kangaslahti, Jonathan Geuter, Nihal V. Nayak +3Model SizeLayer-Wise

  14. Building Multi-Task Agentic LLMs via Two-Phase Distillation

    Jun 29, 2026Huaijie Wang, Shusheng Xu, Yi Wu +1Residual DistillationArtificial Intelligence Systems

  15. From Sparse and Imperfect 2D Anchors to Consistent 3D Gaussian Street Scenes: Support-Aware Appearance

    Jun 24, 2026Long Cao, Zhongquan Wang, Jie Li +43D GaussianAppearance

  16. Channel Location Constrains the Auditability of Subliminal Learning

    Jun 20, 2026Tamas MadlChannelResidual Distillation

  17. Characterize Then Distill: Mechanistic Reasoning in Large Output Spaces

    Jun 5, 2026Debjyoti Saha Roy, Byron C. Wallace, Javed A. AslamMulti-Label ClassificationZero-Shot

  18. PRISM: Synergizing Vision Foundation Models via Self-organized Expert Specialization

    Jun 2, 2026Ying Tang, Dong Li, Youjia Zhang +3Vision Foundation ModelsPrism

  19. Logit Distillation on Manifolds: Mapping by Learning

    May 30, 2026Yiru Yang, Junling Wang, Nishant Kumar Singh +2Residual DistillationTeacher

  20. GAPD: Gold-Action Policy Distillation for Agentic Reinforcement Learning in Knowledge Base Question Answering

    May 28, 2026Xin Sun, Jianan Xie, Zhongqi Chen +6Agentic Reinforcement LearningEfficient On-Policy Distillation

  21. Reasoning-preserved Efficient Distillation of Large Language Models via Activation-aware Initialization

    May 28, 2026Junlin He, Yihong Tang, Tong Nie +5Efficient Large Language ModelSymbolic Distillation

  22. Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation

    May 14, 2026Min Zhao, Hongzhou Zhu, Kaiwen Zheng +6Video GenerationAutoregressive Model

  23. Towards Resource-Efficient LLMs: End-to-End Energy Accounting of Distillation Pipelines

    May 13, 2026Katherine Lambert, Sasha LuccioniEnergy ConsumptionResidual Distillation

  24. Curriculum Learning-Guided Progressive Distillation in Large Language Models

    May 11, 2026Jincheng Cao, Fanzhi Zeng, Leqi Liu +1Knowledge DistillationLarge Language Model Training

  25. Locking Pretrained Weights via Deep Low-Rank Residual Distillation

    May 11, 2026Keitaro Sakamoto, Pierre Ablin, Federico Danieli +1Model-Agnostic DefenseModel Weights

  26. Step Rejection Fine-Tuning: A Practical Distillation Recipe

    May 11, 2026Igor Slinko, Ilia Zavidnyi, Egor Bogomolov +1Swe-Bench VerifiedSupervised Finetuning

  27. CoDistill-GRPO: A Co-Distillation Recipe for Efficient Group Relative Policy Optimization

    May 9, 2026Soo Min Kwon, Ziteng Sun, Ananda Theertha Suresh +2Flow-GrpoKnowledge Distillation

  28. Real Image Denoising with Knowledge Distillation for High-Performance Mobile NPUs

    May 5, 2026Faraz Kayani, Sarmad Kayani, Asad Ahmed +2Neural Processing UnitsMobilenetv2

  29. Dynamics Distillation for Efficient and Transferable Control Learning

    May 2, 2026Xunjiang Gu, Kashyap Chitta, Mahsa Golchoubian +2Autonomous Driving SimulationAutonomous Driving

  30. LEAP: Layer-wise Exit-Aware Pretraining for Efficient Transformer Inference

    May 1, 2026Shashank Kapadia, Deep Naryan Mishra, Sujal Reddy Alugubelli +4Transformer ArchitecturesResidual Distillation

  31. AdvDMD: Adversarial Reward Meets DMD For High-Quality Few-Step Generation

    Apr 29, 2026Xu Wang, Zexian Li, Litong Gong +2Few-Step DistillationFew-Step Generation

  32. Soft Label Pruning and Quantization for Large-Scale Dataset Distillation

    Apr 20, 2026Xiao Lingao, Yang HeDiffusion-Based Dataset DistillationImagenet

  33. TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation

    Apr 16, 2026Xiangyu Liu, Feng Gao, Xiaomei Zhang +4Audio-Video GenerationDataset Distillation