Vision-Language Models

Also known as VLM

Latest papers 491

All topics
CardsList
  1. Source-Modality Monitoring in Vision-Language Models

    Apr 23, 2026Etha Tianze Hua, Tian Yun, Ellie PavlickVision-Language ModelsMultimodal Understanding

  2. R-CoV: Region-Aware Chain-of-Verification for Alleviating Object Hallucinations in LVLMs

    Apr 22, 2026Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr +2Hallucination Detection in VLMsVision-Language Models

  3. Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding

    Apr 22, 2026Yubo Jiang, Yitong An, Xin Yang +7Vision-Language ModelsHallucination in Language Models

  4. Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation

    Apr 22, 2026Xingyu Zhu, Junfeng Fang, Shuo Wang +4Vision-Language ModelsVLM Adaptation

  5. Detecting AI-Generated Content on Social Media with Multi-modal Language Models

    Apr 21, 2026Chenyang Yang, Shen Yan, Yibo Yang +13Vision-Language ModelsAI-Generated Image Detection

  6. PLaMo 2.1-VL Technical Report

    Apr 21, 2026Tommi Kerola, Yuya Masuda, Takashi Masuko +5Visual Question AnsweringVision-Language Models

  7. Disparities In Negation Understanding Across Languages In Vision-Language Models

    Apr 21, 2026Charikleia Moraitaki, Sarah Pan, Skyler Pulling +3VLM EvaluationVision-Language Models

  8. ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting

    Apr 20, 2026Clayton Fields, Casey KenningtonVision-Language ModelsEfficient ViTs

  9. Mitigating Multimodal Hallucination via Phase-wise Self-reward

    Apr 20, 2026Yu Zhang, Chuyang Sun, Kehai Chen +3Vision-Language ModelsHallucination in Language Models

  10. RS-HyRe-R1: A Hybrid Reward Mechanism to Overcome Perceptual Inertia for Remote Sensing Images Understanding

    Apr 19, 2026Gaozhi Zhou, Hu He, Peng Shen +8Remote Sensing Image UnderstandingVisual Question Answering

  11. Towards Joint Quantization and Token Pruning of Vision-Language Models

    Apr 19, 2026Xinqing Li, Xin He, Xindong Zhang +3Vision-Language ModelsVLM Quantization

  12. PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction

    Apr 19, 2026Xueheng Li, Tao Hu, Ke Cao +5Agricultural Image AnalysisVision-Language Models

  13. Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability

    Apr 19, 2026Lijie ZhouCross-Modal LearningVLM Robustness

  14. DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models

    Apr 18, 2026JiYang Wang, Jiawei Chen, Mengqi Xiao +3VLM EvaluationHallucination Detection in VLMs

  15. Channel Attention-Guided Cross-Modal Knowledge Distillation for Referring Image Segmentation

    Apr 18, 2026Chen YangCross-Modal LearningCross-Modal Knowledge Distillation

  16. Information Router for Mitigating Modality Dominance in Vision-Language Models

    Apr 17, 2026Seulgi Kim, Mohit Prabhushankar, Ghassan AlRegibVLM RobustnessVision-Language Models

  17. Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap

    Apr 17, 2026Yige Xu, Yongjie Wang, Zizhuo Wu +3Vision-Language ModelsVLM Adaptation

  18. AstroVLM: Expert Multi-agent Collaborative Reasoning for Astronomical Imaging Quality Diagnosis

    Apr 17, 2026Yaohui Han, Tianshuo Wang, Zixi Zhao +6Vision-Language ModelsVLM Reasoning

  19. VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models

    Apr 16, 2026Huawei Ji, Yuanhao Sun, Yuan Jin +4Vision-Language ModelsEfficient VLM Inference

  20. Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models

    Apr 16, 2026Danae Sánchez Villegas, Samuel Lewis-Lim, Nikolaos Aletras +1CoT FaithfulnessVision-Language Models

  21. AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning

    Apr 16, 2026Peifeng Zhang, Zice Qiu, Donghua Yu +4Visual Question AnsweringVision-Language Models

  22. BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation

    Apr 15, 2026Baoyou Chen, Hanchen Xia, Peng Tu +5Vision-Language ModelsVLM Adaptation

  23. Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models

    Apr 13, 2026Yvon Apedo, Martyna Poreba, Michal Szczepanski +1Vision-Language ModelsEfficient VLM Inference

  24. VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images

    Apr 10, 2026Guanyu Zhou, Yida Yin, Wenhao Chai +3Visual Question AnsweringSynthetic Data Augmentation

  25. Overconfidence and Calibration in Medical VQA: Empirical Findings and Hallucination-Aware Mitigation

    Apr 2, 2026Ji Young Byun, Young-Jin Park, Jean-Philippe Corbeil +1Vision-Language ModelsVLM Hallucination