VLM Evaluation

VLM: Vision-Language Model

Latest papers 649

All topics
CardsList
  1. Auditing Frontier Vision-Language Models for Trustworthy Medical VQA: Grounding Failures, Format Collapse, and Domain Adaptation

    Apr 30, 2026Xupeng Chen, Binbin Shi, Chenqian Le +5VLM EvaluationHealthcare

  2. WaferSAGE: Large Language Model-Powered Wafer Defect Analysis via Synthetic Data Generation and Rubric-Guided Reinforcement Learning

    Apr 30, 2026Ke Xu, Zhongyuan LianVLM EvaluationVisual Question Answering

  3. Revealing the Impact of Visual Text Style on Attribute-based Descriptions Produced by Large Visual Language Models

    Apr 30, 2026Xiaomeng Wang, Martha Larson, Zhengyu ZhaoVLM EvaluationVision-Language Models

  4. Beyond Screenshots: Evaluating VLMs' Understanding of UI Animations

    Apr 28, 2026Chen Liang, Xirui Jiang, Naihao Deng +2VLM EvaluationVideo Understanding

  5. QCalEval: Benchmarking Vision-Language Models for Quantum Calibration Plot Understanding

    Apr 28, 2026Shuxiang Cao, Zijian Zhang, Abhishek Agarwal +29VLM EvaluationIn-Context Learning

  6. VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation

    Apr 28, 2026Divake Kumar, Sina Tayebati, Devashri Naik +2VLM EvaluationVision-Language Models

  7. DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams

    Apr 28, 2026Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande +4VLM EvaluationVisual Reasoning

  8. FCMBench-Video: Benchmarking Document Video Intelligence

    Apr 28, 2026Runze Cui, Fangxin Shang, Yehui Yang +3VLM EvaluationDocument Understanding

  9. Probing CLIP's Comprehension of 360-Degree Textual and Visual Semantics

    Apr 27, 2026Hai Wang, Xiaochen Yang, Mingzhi Dong +1VLM EvaluationVLM Adaptation

  10. A systematic evaluation of vision-language models for observational astronomical reasoning tasks

    Apr 27, 2026Wenke Ren, Hengxiao Guo, Wenwen Zuo +1VLM EvaluationVision-Language Models

  11. AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding Benchmark

    Apr 27, 2026Hongxin Li, Xiping Wang, Jingran Su +4VLM EvaluationGUI Agents

  12. SycoPhantasy: Quantifying Sycophancy and Hallucination in Small Open Weight VLMs for Vision-Language Scoring of Fantasy Characters

    Apr 27, 2026Arya Shah, Deepali Mishra, Chaklam SilpasuwanchaiVLM EvaluationVision-Language Models

  13. ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning

    Apr 27, 2026Yiming Zhang, Jiacheng Chen, Jiaqi Tan +3VLM EvaluationSpatial Reasoning Benchmarks

  14. GAZE: Grounded Agentic Zero-shot Evaluation with Viewer-Level Tools and Literature Retrieval on Rare Brain MRI

    Apr 25, 2026Duaa Alim, Mogtaba Alim, Liam ChalcroftVLM EvaluationRare Disease Diagnosis

  15. When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs

    Apr 23, 2026Pegah Khayatan, Jayneel Parekh, Arnaud Dapogny +3VLM EvaluationLLM Hallucination Mitigation

  16. From Codebooks to VLMs: Evaluating Automated Visual Discourse Analysis for Climate Change on Social Media

    Apr 23, 2026Katharina Prasse, Steffen Jung, Isaac Bravo +4VLM EvaluationSocial Media Analysis

  17. Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models

    Apr 23, 2026Mohammed Safi Ur Rahman Khan, Sanjay Suryanarayanan, Tushar Anand +1VLM EvaluationVLM Robustness

  18. VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought

    Apr 23, 2026Byeonggeuk Lim, Kyeonghyun Kim, JungMin Yun +1VLM EvaluationCoT Reasoning

  19. Can MLLMs "Read" What is Missing?

    Apr 23, 2026Jindi Guo, Chaozheng Huang, Xi FangVLM EvaluationDocument Understanding

  20. OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model

    Apr 22, 2026Qiguang Chen, Chengyu Luan, Jiajun Wu +7VLM EvaluationVisual Reasoning

  21. Evaluating Remote Sensing Image Captions Beyond Metric Biases

    Apr 22, 2026Ziyun Chen, Fan Liu, Liang Yao +3VLM EvaluationRemote Sensing Image Understanding

  22. EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving

    Apr 22, 2026Finn Rasmus Schäfer, Yuan Gao, Dingrui Wang +5VLM EvaluationAutonomous Driving Benchmarks

  23. Culturally uneven urban perception in large language models

    Apr 21, 2026Rong Zhao, Wanqi Liu, Zhizhou Sha +3VLM EvaluationSocial Bias in Language Models

  24. Assessing VLM-Driven Semantic-Affordance Inference for Non-Humanoid Robot Morphologies

    Apr 21, 2026Jess Jones, Raul Santos-Rodriguez, Sabine HauertVLM EvaluationCross-Embodiment Robot Learning

  25. Seeing Candidates at Scale: Multimodal LLMs for Visual Political Communication on Instagram

    Apr 21, 2026Michael Achmann-Denkler, Mario Haim, Christian WolffVLM EvaluationSocial Media Analysis