VLM Distillation

VLM: Vision-Language Model

Latest papers 78

All topics
CardsList
  1. Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding

    May 30, 2026Hee Suk Yoon, Eunseop Yoon, Jaehyun Jang +6Cross-Modal Knowledge DistillationVLM Distillation

  2. Multimodal Distribution Matching for Vision-Language Dataset Distillation

    May 22, 2026Jongoh Jeong, Hoyong Kwon, Minseok Kim +1Cross-Modal LearningCross-Modal Alignment

  3. Visual-Advantage On-Policy Distillation for Vision-Language Models

    May 21, 2026Ruiqi Liu, Xiaolei Lv, Gengsheng Li +8Vision-Language ModelsVLM Distillation

  4. Preferences Order, Ratings Anchor: From Fused Expert Aesthetic Ground Truth to Self-Distillation

    May 19, 2026Yuanpei Zhao, Jie Lin, Chao Zhang +5Pairwise Preference LearningPersonalized Image Aesthetics Assessment

  5. GeoWorld-VLM: Geometry from World Models for Vision-Language Models

    May 15, 2026Renjie Gu, Kaichen Zhou, Yan Luo +1Visual Spatial ReasoningVLM Adaptation

  6. Offline Semantic Guidance for Efficient Vision-Language-Action Policy Distillation

    May 15, 2026Jin Shi, Brady Zhang, Yishun LuVLM DistillationEfficient VLA Model Inference

  7. DeltaPrompts: Escaping the Zero-Delta Trap in Multimodal Distillation

    May 15, 2026Jaehun Jung, Hyunwoo Kim, Brandon Cui +4VLM DistillationVLM Reasoning

  8. OmniThoughtVis: A Scalable Distillation Pipeline for Deployable Multimodal Reasoning Models

    May 12, 2026Yuanhao Yue, Chengyu Wang, Yuanjie Lyu +2VLM DistillationMultimodal Reasoning

  9. LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models

    May 11, 2026Nikolaos Gkalelis, Vasileios MezarisVision-Language ModelsEfficient VLM Inference

  10. Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT

    May 10, 2026Alaa Asfour, Christopher Indris, Leihan Chen +2Cross-Modal Knowledge Distillation3D Spatial Reasoning

  11. BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation

    Apr 15, 2026Baoyou Chen, Hanchen Xia, Peng Tu +5Vision-Language ModelsVLM Adaptation

  12. Gated Relational Alignment via Confidence-based Distillation for Efficient VLMs

    Jan 30, 2026Yanlong Chen, Amirhossein Habibian, Luca Benini +1Cross-Modal Knowledge DistillationVision-Language Models

  13. CLIP-RD: Relational Distillation for Efficient CLIP Knowledge Distillation

    Date pendingJeannie Chung, Hanna Jang, Ingyeong Yang +2Cross-Modal LearningCross-Modal Knowledge Distillation