Vision-Language Models

Also known as VLM

Latest papers 491

All topics
CardsList
  1. BUZZY: Contrastive Scoring to Mitigate Text-Induced Bias in Multimodal Multiple-Choice QA

    Mar 30, 2026Taeyun Roh, Suhyeong Park, Dongyoung Lee +4Vision-Language ModelsMultimodal QA

  2. Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models

    Mar 23, 2026Hayeon Kim, Ji Ha Jang, Junghun James Kim +1Vision-Language ModelsHierarchical Representation Learning

  3. ME-IQA: Memory-Enhanced Image Quality Assessment via Re-Ranking

    Mar 21, 2026Kanglong Fan, Tianhe Wu, Wen Wen +6Memory-Augmented VLMsVision-Language Models

  4. FMMC: Harnessing the Power of Foundation Models for Accurate Material Classification

    Mar 18, 2026Qingran Lin, Fengwei Yang, Chaolun ZhuVision-Language ModelsSynthetic Data Generation

  5. Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks

    Mar 12, 2026Mei Chee Leong, Ying Gu, Hui Li Tan +2VLM EvaluationVision-Language Models

  6. GreenRFM: Learning a resource-efficient radiology vision-language foundation model via supervision-centric pre-training

    Mar 6, 2026Yingtai Li, Shuai Ming, Qiuli Wang +13Medical Imaging Foundation ModelsRadiology VLMs

  7. VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning

    Mar 1, 2026Mingkang Dong, Hongyi Cai, Jie Li +4Vision-Language ModelsData Selection

  8. Robustness of Vision Language Models Against Split-Image Harmful Input Attacks

    Feb 8, 2026Md Rafi Ur Rashid, MD Sadik Hossain Shanto, Vishnu Asutosh Dasu +1VLM RobustnessAdversarial Attacks on VLMs

  9. Same Answer, Different Representations: Hidden instability in VLMs

    Feb 6, 2026Farooq Ahmad Wani, Alessandro Suglia, Rohit Saxena +6VLM EvaluationVLM Robustness

  10. Gated Relational Alignment via Confidence-based Distillation for Efficient VLMs

    Jan 30, 2026Yanlong Chen, Amirhossein Habibian, Luca Benini +1Cross-Modal Knowledge DistillationVision-Language Models

  11. From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion

    Jan 15, 2026Cheng Chen, Yuyu Guo, Pengpeng Zeng +4Vision-Language ModelsVLM Adaptation

  12. Zero-Shot Distracted Driver Detection via Vision Language Models with Double Decoupling

    Jan 13, 2026Takamichi Miyata, Sumiko Miyata, Andrew MorrisVision-Language ModelsAutonomous Driving Perception

  13. CoMa: Contextual Massing Generation with Vision-Language Models

    Jan 13, 2026Evgenii Maslov, Alexandra Vabnits, Vladimir Vorona +6Vision-Language ModelsMultimodal Generation

  14. UniDrive-WM: Unified Understanding, Planning and Generation World Model for Autonomous Driving

    Jan 7, 2026Zhexiao Xiong, Xin Ye, Burhan Yaman +5Vision-Language ModelsWorld Model Learning

  15. Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models

    Dec 16, 2025George-Andrei Dima, Răzvan-Alexandru Smădu, Dumitru-Clementin CercelVisual Question AnsweringImage Captioning

  16. Improving Semantic Uncertainty Quantification in LVLMs with Semantic Gaussian Processes

    Dec 16, 2025Joseph Hoche, Andrei Bursuc, David Brellmann +4Vision-Language ModelsUncertainty Quantification

  17. SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving

    Dec 11, 2025Peizheng Li, Zhenghao Zhang, David Holtz +6Vision-Language ModelsVLMs for Autonomous Driving

  18. How (Mis)calibrated is your Federated CLIP and what to do about it?

    Dec 3, 2025Mainak Singha, Masih Aminbeidokhti, Paolo Casari +3Vision-Language ModelsVLM Adaptation

  19. Vision-Language Memory for Spatial Reasoning

    Nov 25, 2025Zuntao Liu, Yi Du, Taimeng Fu +3Memory-Augmented VLMsVision-Language Models

  20. T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs

    Nov 20, 2025Shao-Jun Xia, Huixin Zhang, Zhengzhong TuVision-Language ModelsIn-Context Learning

  21. GraphPilot: Grounded Scene Graph Conditioning for Language-Based Autonomous Driving

    Nov 14, 2025Fabian Schmidt, Markus Enzweiler, Abhinav ValadaVision-Language ModelsVLMs for Autonomous Driving

  22. TokenSwap: Backdoor Attack on the Compositional Understanding of Large Vision-Language Models

    Sep 29, 2025Zhifang Zhang, Qiqi Tao, Jiaqi Lv +3VLM RobustnessAdversarial Attacks on VLMs

  23. HERMAN: Hierarchical Representation Matching for CLIP-based Class-Incremental Learning

    Sep 26, 2025Zhen-Hao Xie, Yan Wang, Lan Li +3Class-Incremental LearningVision-Language Models

  24. Image Recognition with Vision and Language Embeddings of VLMs

    Sep 11, 2025Illia Volkov, Nikita Kisel, Klara Janouskova +1Image ClassificationVLM Evaluation

  25. TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding

    Aug 11, 2025Chaohong Guo, Xun Mo, Yongwei Nie +3Temporal Video GroundingVision-Language Models

  26. SalQ-VLM: Fine-Grained Saliency-Guided Quantization for Vision-Language Models

    Aug 5, 2025Yufei Xue, Yushi Huang, Lunjie Zhu +2Vision-Language ModelsVLM Quantization