Modality Gap in VLMs

VLM: Vision-Language Model

Latest papers 24

All topics
CardsList
  1. Visual Branch is What You Need for CLIP-based Class-Incremental Learning

    Sep 29, 2026Tao Hu, Zhen-Hao Xie, Jingcai Guo +2Class-Incremental LearningModality Gap in VLMs

  2. Dual-Mode Low-Rank Learner with Bridge-Prototype Ensemble for Vision-Language Class-Incremental Learning

    Sep 29, 2026Chiyuan He, Zihuan Qiu, Fanman Meng +5Prototype-Based LearningLow-Rank Adaptation

  3. How Medical VLMs Underutilize Their Vision Encoders: A Dermatology Perspective

    Sep 29, 2026Janet Wang, Yunbei Zhang, Xiao Wang +1Medical DiagnosisVLM Interpretability

  4. Render Before Reading: Visual Rendering as a Prompt Injection Defense

    Sep 28, 2026Jie Zhang, Andrei Baroian, Jan N. van Rijn +2Multimodal Large Language ModelsModality Gap in VLMs

  5. Efficient Quantization-Aware Distillation with Cross-Modal Alignment for Edge Vision-Language Models

    Sep 15, 2026Jinwoo Jeon, GyuYeop Do, Yubin Lim +4VLM QuantizationEfficient VLM Inference

  6. TwinICL: Diagnosing Multimodal In-Context Learning through Paired Counterfactuals

    Sep 14, 2026Zihan Xue, Po-Yi Lu, Serhii Honcharenko +5Multimodal ICLModality Gap in VLMs

  7. MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein

    Jun 28, 2026Hong-Han Wang, Yuntao Wang, Hu DingLarge Vision-Language ModelsVLM Reasoning

  8. MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias

    Jun 16, 2026Xingming Li, Ao Cheng, Qiyao Sun +4VLM RobustnessVision-Language Models

  9. Beyond Symmetric Alignment: Spectral Diagnostics of Modality Imbalance in Vision-Language Models in the Medical Domain

    Jun 3, 2026Alessandro Gambetti, Qiwei Han, Cláudia Soares +1VLM EvaluationModality Imbalance

  10. Density-Aware Translation of Spurious Correlations in Zero-Shot VLMs

    Jun 1, 2026Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie +1VLM RobustnessVision-Language Models

  11. LoMo: Local Modality Substitution for Deeper Vision-Language Fusion

    May 28, 2026Feng Han, Zhixiong Zhang, Zheming Liang +2Cross-Modal LearningVLM Robustness

  12. Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models

    May 26, 2026Yuanwei Hu, Bo Peng, Yadan Luo +3Vision-Language ModelsTest-Time Adaptation

  13. Medical Context Distorts Decisions in Clinical Vision Language Models

    May 17, 2026David Restrepo, Ira Ktena, Maria Vakalopoulou +2VLM EvaluationVLM Robustness

  14. When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models

    May 7, 2026Harshvardhan Saini, Samyak Jha, Yiming Tang +1Vision-Language ModelsObject Hallucination in VLMs

  15. Jailbreaking Vision-Language Models Through the Visual Modality

    May 1, 2026Aharon Azulay, Jan Dubiński, Zhuoyun Li +2Adversarial Attacks on VLMsVision-Language Models

  16. Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap

    Apr 17, 2026Yige Xu, Yongjie Wang, Zizhuo Wu +3Vision-Language ModelsVLM Adaptation

  17. BabyVision: Visual Reasoning Beyond Language

    Jan 10, 2026Liang Chen, Weichu Xie, Yiyan Liang +27VLM EvaluationVisual Reasoning