VLM Evaluation

VLM: Vision-Language Model

Latest papers 658

All topics
CardsList
  1. MMGist: A Comprehensive Multimodal Benchmark for 2027

    Jun 21, 2026Wenzhen Yuan, Jiacheng Ruan, Wutao Xiong +3VLM EvaluationLarge Vision-Language Models

  2. Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

    Jun 20, 2026Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh RaoVLM EvaluationZero-Shot Learning

  3. MEDLAYXPLAIN: Benchmarking the Expert-Lay Gap in Medical Vision-Language Models

    Jun 19, 2026Han Jang, Junhyeok Lee, Songsoo Kim +4VLM EvaluationMedical VLMs

  4. CheXpercept: A Benchmark for Evaluating Expert-Level Lesion Perception in Chest X-rays

    Jun 19, 2026Geon Choi, Hangyul Yoon, Nalee Kim +5VLM EvaluationMedical Imaging

  5. Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City

    Jun 18, 2026Adrian Cespedes, Marcelo Chincha, Dunant Cusipuma +3VLM EvaluationAutonomous Driving Datasets

  6. LaViSA: A Language and Vision Structural Ambiguity Benchmark

    Jun 17, 2026Lee Sangmyeong, Shun Inadumi, Koichiro YoshinoVLM EvaluationVision-Language Models

  7. Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models

    Jun 17, 2026Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin +10VLM EvaluationVision-Language-Action Models

  8. REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation

    Jun 17, 2026Tengjie Lin, Yutao Sun, Jingwei Ni +7VLM EvaluationVisual Question Answering

  9. Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis

    Jun 17, 2026Hong-Tao Yu, Chen-Wei Xie, Yuxin Peng +2VLM EvaluationVLM Robustness

  10. How Well Can Your Video Model Remember? Measuring Memory-Budget Trade-offs in Long Video Understanding

    Jun 17, 2026Yixian TianVLM EvaluationStreaming Video Understanding

  11. Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images

    Jun 16, 2026Yunzhe Xue, Mohammed Saim Ahmed Quadri, Neal Panse +2VLM EvaluationMedical VQA

  12. CaVe-VLM-CoT: An Interpretable Vision-Language Model Framework

    Jun 16, 2026Sneha Rao, Shaina Raza, Dhanesh RamachandramVLM EvaluationVision-Language Grounding

  13. LongWebBench: Evaluating Structural and Functional Webpage Generation in Long-Horizon Settings

    Jun 16, 2026Yi Zhao, Zhen Yang, Mengpan Chen +5VLM EvaluationWeb Application Generation

  14. Vision-language models for chest radiography do not always need the image

    Jun 16, 2026Mahshad Lotfinia, Sebastian Ziegelmayer, Lisa Adams +4VLM EvaluationMedical VQA

  15. LADBench: A Benchmark for Logical Fault Detection in Images

    Jun 16, 2026Sahasra Kondapalli, Lara Radovanovic, Aadi Palnitkar +2VLM EvaluationMultimodal Reasoning

  16. Attention Alignment Between Humans and Vision-Language Models

    Jun 16, 2026Isaac R. Christian, Udith Haputhanthrige, Hanna Hornfeld +4VLM EvaluationVisual Attention

  17. Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models

    Jun 16, 2026Logan Mann, Yi Xia, Ajit Saravanan +6VLM EvaluationVLM Robustness

  18. Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation

    Jun 15, 2026Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina +1VLM EvaluationMultilingual Language Models

  19. Uncertainty Is Not a Safety Net for Clinical VQA, but Can It Anticipate Model Failure?

    Jun 15, 2026Arnisa Fazla, Alberto Testoni, Ameen Abu-Hanna +2VLM EvaluationVLM Robustness

  20. Lost at the End: Primacy Bias in Multimodal Retrieval-Augmented Question Answering

    Jun 15, 2026Jieyuan Liu, Jianyang Gu, Shijie Chen +2VLM EvaluationMultimodal RAG

  21. Chronological Blindness: Benchmarking Temporal Reasoning in Vision-Language Models with CHRONOSIGHT

    Jun 15, 2026Parthaw Goswami, Jaynto Goswami DeepVLM EvaluationTemporal Reasoning

  22. TimeVista: Exploring and Exploiting Vision-Language Models as Judges for Time Series Forecasting

    Jun 15, 2026Zhi Chen, Yuxuan Wang, Jialong Wu +5VLM EvaluationForecasting Benchmarks

  23. Calibrated Triage, Not Autonomy: Confidence Estimation for Medical Vision-Language Models

    Jun 14, 2026Reza Khanmohammadi, Kundan Thind, Mohammad M. GhassemiVLM EvaluationSelective Prediction

  24. Comparing Human Gaze and Vision-Language Model Attention in Safety-Relevant Environments

    Jun 13, 2026Marta Vallejo, Siwen WangVLM EvaluationLarge Vision-Language Models