VLM Evaluation

VLM: Vision-Language Model

Latest papers 649

All topics
CardsList
  1. SVCBench: A Streaming Video Counting Benchmark for Spatial-Temporal State Maintenance

    Mar 13, 2026Pengyiang Liu, Zhongyue Shi, Hongye Hao +7VLM EvaluationStreaming Video Understanding

  2. Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks

    Mar 12, 2026Mei Chee Leong, Ying Gu, Hui Li Tan +2VLM EvaluationVision-Language Models

  3. Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild

    Mar 4, 2026Changda Zhou, Ziyue Gao, Xueqing Wang +4VLM EvaluationDocument Parsing

  4. VectorGym: A Multi-Task Benchmark for SVG Code Generation, Sketching and Editing

    Feb 22, 2026Joan Rodriguez, Haotian Zhang, Abhay Puri +14VLM EvaluationCode Generation

  5. An Online Reference-Free Evaluation Framework for Flowchart Image-to-Code Generation

    Feb 13, 2026Giang Son Nguyen, Zi Pong Lim, Sarthak Ketanbhai Modi +2VLM EvaluationCode Generation

  6. VideoSTF: Stress-Testing Output Repetition in Video Large Language Models

    Feb 11, 2026Yuxin Cao, Wei Song, Shangzhi Xu +2VLM EvaluationVLM Robustness

  7. Egocentric Bias in Vision-Language Models

    Feb 10, 2026Maijunxian Wang, Yijiang Li, Bingyang Wang +6VLM EvaluationVisual Spatial Reasoning

  8. Same Answer, Different Representations: Hidden instability in VLMs

    Feb 6, 2026Farooq Ahmad Wani, Alessandro Suglia, Rohit Saxena +6VLM EvaluationVLM Robustness

  9. Toward Scalable Audio Description Quality Control: A Workflow for Evaluating Human and VLM Raters

    Feb 1, 2026Lana Do, Gio Jung, Juvenal Francisco Barajas +5VLM EvaluationHuman-in-the-Loop Evaluation

  10. TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs

    Jan 30, 2026Baiqi Li, Kangyi Zhao, Ce Zhang +3VLM EvaluationVideo Understanding

  11. A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions

    Jan 30, 2026Ji Zhou, Yilin Ding, Yongqi Zhao +4VLM EvaluationLarge Vision-Language Models

  12. DisasterInsight: A Building-Centric Benchmark for Evaluating Vision--Language Models in Disaster Response

    Jan 26, 2026Sara Tehrani, Yonghao Xu, Leif Haglund +3VLM EvaluationRemote Sensing Image Understanding

  13. BabyVision: Visual Reasoning Beyond Language

    Jan 10, 2026Liang Chen, Weichu Xie, Yiyan Liang +27VLM EvaluationVisual Reasoning

  14. NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding

    Jan 3, 2026Hyeonjeong Ha, Jinjin Ge, Bo Feng +2VLM EvaluationVideo Understanding

  15. MUSON: A Reasoning-oriented Multimodal Dataset for Socially Compliant Navigation in Urban Environments

    Dec 28, 2025Zhuonan Liu, Xinyu Zhang, Zishuo Wang +8VLM EvaluationSocial Robot Navigation

  16. 6 Fingers, 1 Kidney: Natural Adversarial Medical Images Reveal Critical Weaknesses of Vision-Language Models

    Dec 3, 2025Leon Mayer, Piotr Kalinowski, Caroline Ebersbach +6VLM EvaluationVLM Robustness

  17. ASCIIBench: Evaluating Language-Model-Based Understanding of Visually-Oriented Text

    Dec 2, 2025Kerry Luo, Michael Fu, Joshua Peguero +6VLM EvaluationLLM Evaluation

  18. Understanding the Effects of Distractors on Reasoning Vision-Language Models

    Nov 26, 2025Jiyun Bae, Hyunjong Ok, Sangwoo Mo +1VLM EvaluationVisual Question Answering

  19. VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs

    Nov 25, 2025Tianxiang Jiang, Sheng Xia, Yicheng Xu +5VLM EvaluationMultimodal Large Language Models

  20. Diagnosing Corruption-Induced Reliability Failures in Vision-Language Models

    Nov 24, 2025Xiangjie Sui, Songyang Li, Hanwei Zhu +3VLM EvaluationVLM Robustness

  21. BackdoorVLM: A Benchmark for Backdoor Attacks and Defenses on Vision-Language Models

    Nov 24, 2025Juncheng Li, Yige Li, Hanxun Huang +5VLM EvaluationVLM Robustness

  22. Thinking Ahead: Foresight Intelligence in MLLMs and World Model

    Nov 24, 2025Zhantao Gong, Liaoyuan Fan, Qing Guo +3VLM EvaluationVLM Adaptation

  23. RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios

    Nov 22, 2025Jun Zhang, Xin Zhang, Jie Feng +5VLM EvaluationSpatial Reasoning Benchmarks

  24. MMLongCite: A Benchmark for Evaluating Faithfulness of Long-Context Vision-Language Models

    Oct 15, 2025Keyan Zhou, Zecheng Tang, Lingfeng Ming +9VLM EvaluationVision-Language Grounding

  25. Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy

    Sep 22, 2025Geewook Kim, Minjoon SeoVLM EvaluationAudio-Visual Understanding