VLM Distillation

VLM: Vision-Language Model

Latest papers 78

All topics
CardsList
  1. Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes

    Oct 1, 2026Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc +2VLM DistillationMultimodal Large Language Models

  2. HAWK: Rethinking Multimodal Drafting for Speculative Decoding

    Sep 30, 2026Wenhan Yang, Anirudh Rao, Ashwin ChandraEfficient Multimodal InferenceVLM Distillation

  3. MCD: Causal Distillation of Multimodal In-Context Learning in Large Vision-Language Models

    Sep 30, 2026Yanshu Li, Jiaqian Li, Canran Xiao +3Cross-Modal Knowledge DistillationMultimodal ICL

  4. RS-OPSD: Reliable Privileged On-Policy-Self-Distillation for Ultra-High-Resolution Remote Sensing VQA

    Sep 29, 2026Chengjie Jiang, Yunqi Zhou, Jiafeng Yan +3Remote Sensing Image UnderstandingVisual Question Answering

  5. On-Policy Visual Evidence Distillation

    Sep 29, 2026Shaohang Wei, Feifan Song, Guangyue Peng +9VLM DistillationVisually Grounded Reasoning

  6. Evidence-Aligned Multimodal On-Policy Self-Distillation for Fine-Grained Visual Understanding

    Sep 28, 2026Nanxing Hu, Qiwei Yan, Jinchao Zhang +1On-Policy Self-DistillationVLM Distillation

  7. Counterfactual Attention Policy Distillation for Temporal Video Grounding

    Sep 28, 2026Shaobo Ju, Haiyang Yu, Xuecheng Wu +5Temporal Video GroundingVLM Distillation

  8. Distilling Visual Reasoning into Text Space

    Sep 28, 2026Wenhan Yang, Nilay Naharas, Ali Payani +1CoT DistillationVLM Distillation

  9. SCOPD: Sparse-Context On-Policy Self-Distillation for Efficient Vision-Language Models

    Sep 28, 2026Ahmadreza Jeddi, Enming Zhang, Jasper Gerigk +12Efficient VLM InferenceOn-Policy Self-Distillation

  10. Position Aware Layer Queries for Test Time Training in Vision Language Models

    Sep 27, 2026Rajat Modi, Priyank Pathak, Xin Liang +1Test-Time Adaptation of VLMsVLM Distillation

  11. TTRSD: Test-Time Reinforcement Learning with Self-Distillation for Vision-Language Models

    Sep 27, 2026Shuning Wang, Zhiheng Wu, Xun Zhou +8Test-Time Adaptation of VLMsVLM Distillation

  12. Fewer Tokens, More Self-Teaching: On-Policy Self-Distillation for Extreme Visual Token Reduction

    Sep 26, 2026Junxian Li, Ruixuan Yang, Tianao Zhang +3Efficient VLM InferenceVLM Distillation

  13. BAS-OPD: Budget-Aware Selective On-Policy Self-Distillation for Fine-Grained Multimodal Perception

    Sep 22, 2026Zihan Chen, Hengguang Zhou, Yuan Kang +5VLM DistillationMultimodal Large Language Models

  14. Efficient Quantization-Aware Distillation with Cross-Modal Alignment for Edge Vision-Language Models

    Sep 15, 2026Jinwoo Jeon, GyuYeop Do, Yubin Lim +4VLM QuantizationEfficient VLM Inference

  15. Efficient Reasoning Distillation: Small Video-Language Models via Synthetic CoT and Difficulty-Aware Fine-Tuning

    Sep 14, 2026Mantek Singh, Jeshwanth Challagundla, Siddharth Raina +1CoT DistillationVLM Distillation

  16. Semantically Aligned Gradient-Driven Context-Preserving Image Editing

    Sep 14, 2026Chiranjeev Chiranjeev, Muskan Dosi, Mayank Vatsa +1Text-Guided Image EditingVLM Distillation

  17. On-Policy Distillation for Vision-Language Model Adaptation, an Effective Paradigm on Low-Quality Multimodal Data

    Sep 9, 2026Hongyuan Zhang, Xianda Guo, Yanlun Peng +6VLM AdaptationVLM Distillation

  18. Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding

    Aug 26, 2026Kaishen Wang, Dongdi Zhao, Yijun Liang +4On-Policy Self-DistillationVLM Distillation

  19. Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning

    Aug 17, 2026Ao Shen, Yongheng Zhang, Yinghui Li +3VLM DistillationVideo Reasoning

  20. DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation

    Aug 11, 2026Zhuchenyang Liu, Ziyi Wang, Yao Zhang +1VLM DistillationVisual Document Retrieval

  21. Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots

    Aug 10, 2026Shravan Venkatraman, Omkar Thawakar, Ritesh Thawkar +2VLM DistillationLarge Vision-Language Models

  22. SignLlama: Enhancing Gloss-free Sign Language Translation by Prioritizing Visual Features for LLMs

    Aug 10, 2026Shiwei Gan, Xiao Liu, Yafeng Yin +5Sign Language TranslationVLM Adaptation

  23. Distilling Vision-Language Models for Robust Traffic Sign Perception in Autonomous Vehicles

    Aug 9, 2026Pedram MohajerAnsari, Amir Salarpour, Mert D. PeséAdversarial RobustnessVLM Distillation

  24. OPD-V: Visual On-Policy Self-Distillation with Modality Balance

    Aug 5, 2026Aniri, Jinhe Bi, Peng Liao +5Modality ImbalanceOn-Policy Self-Distillation

  25. When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation

    Aug 4, 2026Yinuo Jiang, Yongjie Ye, Zhou Tao +4VLM DistillationLanguage Model Distillation