VLM Evaluation

VLM: Vision-Language Model

Latest papers 658

All topics
CardsList
  1. Natural Language Camera Movement Understanding

    Jul 3, 2026Yuwen Tan, Joey Huang, Jin Huang +2VLM EvaluationVideo-Language Models

  2. VISTA: Auditing Semantic Divergence in Vision-Language Models

    Jul 3, 2026Junchi Liao, Jiawen Deng, Fuji RenVLM EvaluationVision-Language Models

  3. GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

    Jul 3, 2026Fang Liu, Jinpeng Chen, Ke Xu +7VLM EvaluationStreaming Video Understanding

  4. MatPhaseBench: A Semantics-Guided Benchmark for Materials Phase Diagrams Understanding

    Jul 3, 2026Hanwen Wang, Sihan Liang, Zhiwei Liu +4VLM EvaluationAI for Science

  5. Prior Bias in Vision Language Models on UML Diagram Interpretation

    Jul 3, 2026Zaiyu Cheng, Khai-Nguyen Nguyen, Antonio MastropaoloVLM EvaluationSoftware Engineering

  6. Search-based Testing of Vision Language Models for In-Car Scene Understanding

    Jul 2, 2026Lev Sorokin, Chen Yang, Ken E. Friedl +1VLM EvaluationAutomated Test Generation

  7. AnyGroundBench: A Multi-Domain Adaptation Benchmark for Video Grounding in VLMs

    Jul 2, 2026Rintaro Otsubo, Ryo Fujii, Reina Ishikawa +6VLM EvaluationTemporal Video Grounding

  8. Evaluating Vision-Language Models as a Zero-Shot Learning Alternative to You Only Look Once and Optical Character Recognition for Nigerian License Plate Recognition

    Jul 2, 2026Ismail Ismail Tijjani, Ahmad Abubakar Mustapaha, Sunusi Ibrahim Muhammad +1VLM EvaluationZero-Shot Learning

  9. Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias

    Jul 2, 2026Sofiane Ouaari, Kevin Vorwalder, Nico PfeiferVLM EvaluationImage Corruption Robustness

  10. MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

    Jul 2, 2026Yuanzhi Liu, Shousheng Zhao, Bo Zhou +2VLM EvaluationBenchmark Construction

  11. Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task

    Jul 1, 2026Yiqian Liu, Iuliia Kotseruba, John K. TsotsosVLM EvaluationVision-Language Models

  12. MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models

    Jul 1, 2026Sihan Chen, Jiale Li, Jianghang Lin +1VLM EvaluationHallucination Detection in VLMs

  13. LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models

    Jul 1, 2026Arpita Nema, Hanwei Zhu, Xi Zhang +1VLM EvaluationVideo Quality Assessment

  14. MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos

    Jul 1, 2026Leyuan Yu, Xiao Tang, Minghao Liu +6VLM EvaluationSpatial Reasoning Benchmarks

  15. StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning

    Jul 1, 2026Yuan Qing, Chengzhi Mao, Boqing GongVLM EvaluationVLM Robustness

  16. Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting

    Jun 30, 2026Qian Ma, S M Rayeed, Charles V. Stewart +2VLM EvaluationVisual Question Answering

  17. Criterion-Conditional In-Context Learning: Evaluating Criterion-Shift Adaptation in Vision-Language Models

    Jun 30, 2026Kaiyun Yang, Ruilin Yang, Zhimin Yao +2VLM EvaluationMultimodal ICL

  18. No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs

    Jun 30, 2026Haojian Huang, Harold Haodong Chen, Meng Luo +6VLM EvaluationMultimodal Hallucination

  19. Seeing Is Not Sharing: Some Vision-Language Models Overestimate Common Ground in Asymmetric Dialogue

    Jun 30, 2026Nan Li, Albert Gatt, Massimo PoesioVLM EvaluationVision-Language Grounding

  20. Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?

    Jun 30, 2026Ta Duc Huy, Trang Nguyen, Townim Chowdhury +5VLM EvaluationVisual Question Answering

  21. Beyond Single Character: Evaluating MLLMs for Sentence-Level Oracle Bone Inscription Understanding

    Jun 30, 2026Ziqi Li, Zijian Chen, Tingzhu Chen +1VLM EvaluationDocument Understanding

  22. SADL: What to Ignore? A Benchmark for Subject-Aware Distractor Localization

    Jun 29, 2026Cao-Tri Nguyen, Nguyen-Khoa Luong, Vinh-Tiep Nguyen +1VLM EvaluationLarge Vision-Language Models

  23. From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA

    Jun 29, 2026Sena Korkut, María Alejandra Bravo Sarmiento, Sanghwan Kim +1VLM EvaluationVision-Language Models

  24. SHOVIR: A Benchmark for Evaluating Vision Shortcut Learning in Radiology Report Generation

    Jun 29, 2026Filippo Ruffini, Marco Salmé, Rosa Sicilia +2VLM EvaluationRadiology Report Generation

  25. Resolution Thresholds in VLM Detection of Harmful ASCII Art Across Construction Modes and Languages

    Jun 28, 2026Yikai Hua, Peter WestVLM EvaluationVLM Robustness

  26. Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning

    Jun 28, 2026Taozhao Chen, Ian Manchester, Huaming ChenVLM EvaluationPhysical Reasoning

  27. Low-cost concept-based localized explanations: How far can we get with training-free approaches?

    Jun 27, 2026Darian Fernández-Gutiérrez, Rafael Bello, Marilyn Bello +1VLM EvaluationZero-Shot Learning

  28. On Test-Time Scaling for Vision-Language Models

    Jun 27, 2026Fawaz Sammani, Tzoulio Chamiti, Nikos DeligiannisVLM EvaluationTest-Time Scaling for VLMs