Vision-Language Models

Also known as VLM

Latest papers 480

All topics
CardsList
  1. Mitigating Multimodal Hallucination via Phase-wise Self-reward

    Apr 20, 2026Yu Zhang, Chuyang Sun, Kehai Chen +3Vision-Language ModelsHallucination in Language Models

  2. RS-HyRe-R1: A Hybrid Reward Mechanism to Overcome Perceptual Inertia for Remote Sensing Images Understanding

    Apr 19, 2026Gaozhi Zhou, Hu He, Peng Shen +8Remote Sensing Image UnderstandingVisual Question Answering

  3. Towards Joint Quantization and Token Pruning of Vision-Language Models

    Apr 19, 2026Xinqing Li, Xin He, Xindong Zhang +3Vision-Language ModelsVLM Quantization

  4. PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction

    Apr 19, 2026Xueheng Li, Tao Hu, Ke Cao +5Agricultural Image AnalysisVision-Language Models

  5. Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability

    Apr 19, 2026Lijie ZhouCross-Modal LearningVLM Robustness

  6. DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models

    Apr 18, 2026JiYang Wang, Jiawei Chen, Mengqi Xiao +3VLM EvaluationHallucination Detection in VLMs

  7. Channel Attention-Guided Cross-Modal Knowledge Distillation for Referring Image Segmentation

    Apr 18, 2026Chen YangCross-Modal LearningCross-Modal Knowledge Distillation

  8. Information Router for Mitigating Modality Dominance in Vision-Language Models

    Apr 17, 2026Seulgi Kim, Mohit Prabhushankar, Ghassan AlRegibVLM RobustnessVision-Language Models

  9. Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap

    Apr 17, 2026Yige Xu, Yongjie Wang, Zizhuo Wu +3Vision-Language ModelsVLM Adaptation

  10. AstroVLM: Expert Multi-agent Collaborative Reasoning for Astronomical Imaging Quality Diagnosis

    Apr 17, 2026Yaohui Han, Tianshuo Wang, Zixi Zhao +6Vision-Language ModelsVLM Reasoning

  11. VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models

    Apr 16, 2026Huawei Ji, Yuanhao Sun, Yuan Jin +4Vision-Language ModelsEfficient VLM Inference

  12. Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models

    Apr 16, 2026Danae Sánchez Villegas, Samuel Lewis-Lim, Nikolaos Aletras +1CoT FaithfulnessVision-Language Models

  13. AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning

    Apr 16, 2026Peifeng Zhang, Zice Qiu, Donghua Yu +4Visual Question AnsweringVision-Language Models

  14. BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation

    Apr 15, 2026Baoyou Chen, Hanchen Xia, Peng Tu +5Vision-Language ModelsVLM Adaptation

  15. Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models

    Apr 13, 2026Yvon Apedo, Martyna Poreba, Michal Szczepanski +1Vision-Language ModelsEfficient VLM Inference

  16. VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images

    Apr 10, 2026Guanyu Zhou, Yida Yin, Wenhao Chai +3Visual Question AnsweringSynthetic Data Augmentation

  17. Overconfidence and Calibration in Medical VQA: Empirical Findings and Hallucination-Aware Mitigation

    Apr 2, 2026Ji Young Byun, Young-Jin Park, Jean-Philippe Corbeil +1Vision-Language ModelsVLM Hallucination

  18. BUZZY: Contrastive Scoring to Mitigate Text-Induced Bias in Multimodal Multiple-Choice QA

    Mar 30, 2026Taeyun Roh, Suhyeong Park, Dongyoung Lee +4Vision-Language ModelsMultimodal QA

  19. Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models

    Mar 23, 2026Hayeon Kim, Ji Ha Jang, Junghun James Kim +1Vision-Language ModelsHierarchical Representation Learning

  20. ME-IQA: Memory-Enhanced Image Quality Assessment via Re-Ranking

    Mar 21, 2026Kanglong Fan, Tianhe Wu, Wen Wen +6Memory-Augmented VLMsVision-Language Models

  21. FMMC: Harnessing the Power of Foundation Models for Accurate Material Classification

    Mar 18, 2026Qingran Lin, Fengwei Yang, Chaolun ZhuVision-Language ModelsSynthetic Data Generation

  22. Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks

    Mar 12, 2026Mei Chee Leong, Ying Gu, Hui Li Tan +2VLM EvaluationVision-Language Models

  23. GreenRFM: Learning a resource-efficient radiology vision-language foundation model via supervision-centric pre-training

    Mar 6, 2026Yingtai Li, Shuai Ming, Qiuli Wang +13Medical Imaging Foundation ModelsRadiology VLMs

  24. VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning

    Mar 1, 2026Mingkang Dong, Hongyi Cai, Jie Li +4Vision-Language ModelsData Selection

  25. Robustness of Vision Language Models Against Split-Image Harmful Input Attacks

    Feb 8, 2026Md Rafi Ur Rashid, MD Sadik Hossain Shanto, Vishnu Asutosh Dasu +1VLM RobustnessAdversarial Attacks on VLMs