VLM Evaluation

VLM: Vision-Language Model

Latest papers 658

All topics
CardsList
  1. Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation

    Jun 26, 2026Anya Ji, Abhijith Varma Mudunuri, David M. Chan +1VLM Evaluation

  2. DataComp-VLM: Improved Open Datasets for Vision-Language Models

    Jun 26, 2026Matteo Farina, Vishaal Udandarao, Thao Nguyen +33VLM EvaluationTraining Data Curation

  3. HumanMoveVQA: Can Video MLLMs reason about human movement in videos?

    Jun 26, 2026Pulkit Gera, Faegheh Sardari, Asmar Nadeem +4VLM EvaluationSpatial Reasoning Benchmarks

  4. Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

    Jun 26, 2026Hohin Kwan, Hongyu Li, Ray Zhang +5VLM EvaluationMultimodal Large Language Models

  5. Aloe-Vision: Robust Vision-Language Models for Healthcare

    Jun 25, 2026Jaume Guasch-Martí, Enrique Lopez-Cuena, Martín Suárez-Fernández +3VLM EvaluationVLM Robustness

  6. FlameVQA: A Physically-Grounded UAV Wildfire VQA Benchmark with Radiometric Thermal Supervision

    Jun 25, 2026Mobin Habibpour, John Spodnik, Niloufar Alipour Talemi +1VLM EvaluationVisual Question Answering

  7. GAVEL: Grounded Caption Error Verification and Localization

    Jun 25, 2026Zixian Gao, Atsushi Hashimoto, Kuniaki SaitoVLM EvaluationText-Image Alignment

  8. From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP

    Jun 25, 2026Zhixing Li, Yinan YuVLM EvaluationSpatial Reasoning Benchmarks

  9. How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations

    Jun 24, 2026Yuxing Cheng, Yuan Wu, Yi ChangVLM EvaluationVLM Robustness

  10. ShutterMuse: Capture-Time Photography Guidance with MLLMs

    Jun 24, 2026Jiayu Li, Yixiao Fang, Tianyu Hu +5VLM EvaluationMultimodal Large Language Models

  11. C3-Bench: A Context-Aware Change Captioning Benchmark

    Jun 24, 2026Jae-Woo Kim, Hyeongbeom Kim, Ue-Hwan KimVLM Evaluation

  12. Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation

    Jun 24, 2026Atin Pothiraj, Jaemin Cho, Yue Zhang +2VLM EvaluationPhysical Consistency in Video Generation

  13. Are We There Yet? Exploring the Capabilities of MLLMs in Assistive AI Applications

    Jun 23, 2026Shayon Dasgupta, Avijit Dasgupta, C. V. JawaharVLM EvaluationScene Text Recognition

  14. EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence

    Jun 23, 2026Linpeng Huang, Weixing Chen, Zexin Chen +2VLM EvaluationTemporal Video Grounding

  15. EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding

    Jun 23, 2026Yijia Lei, Jinzhao Li, Yichi Zhang +3VLM EvaluationStreaming Video Understanding

  16. PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models

    Jun 23, 2026Simone Gallivanone, Hossein Khodadadi, Mauro Dore +2VLM EvaluationVLM Robustness

  17. Ill-Posed by Design: Probing Evidence Use in VLMs

    Jun 23, 2026Boaz Meivar, Shaked Perek, Shani Shvartzman +2VLM EvaluationCounterfactual Evaluation of VLMs

  18. A Benchmark for Hallucination Detection in VLMs for Gastrointestinal Endoscopy

    Jun 23, 2026Aminu Lawal, Niyoj Oli, Sachin Acharya +3VLM EvaluationHallucination Detection in VLMs

  19. REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs

    Jun 22, 2026Yifei Zhao, Qian Lou, Mengxin ZhengVLM EvaluationVLM Robustness

  20. Listening makes Vision Clear for VLMs

    Jun 22, 2026Yiyang Chen, Yixin Tan, Binrui ShenVLM EvaluationVisual Attention

  21. MotionHalluc: Diagnosing Kinematic Hallucinations in Fine-Grained Motion Reasoning

    Jun 22, 2026Weile Guo, Shenghong He, Danying Mo +3VLM EvaluationSpatiotemporal Reasoning

  22. Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation

    Jun 22, 2026Yu Cao, Ziquan Liu, Zhensong Zhang +3VLM EvaluationPhysical Consistency in Video Generation

  23. RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis

    Jun 22, 2026Minh-Loi Nguyen, Nghiem Tuong Diep, Hung Khang Nguyen +10VLM EvaluationRobot Manipulation Benchmarks

  24. Chains That See, Answers That Don't: A Multi-Aspect Evaluation Recipe for Forced Chain-of-Thought on Video-MME

    Jun 22, 2026Zhichao Fan, Yanhang Li, Zexin ZhuangVLM EvaluationVideo QA

  25. MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ?

    Jun 21, 2026Srinivas Venkatanarayanan, Clement Pakkam IsaacVLM EvaluationSpatial Reasoning Benchmarks

  26. Benchmarking Vision-Language Models for Microscopic Plant Image Understanding

    Jun 21, 2026Tianqi Wei, Xin Yu, Zhi Chen +2VLM EvaluationMicroscopy Image Analysis

  27. CVSBench: A Comprehensive Benchmark for Cross-view Spatial Reasoning and Dreaming

    Jun 21, 2026Ruixun Liu, Lingyu Zhang, Lanxuan Xue +3VLM EvaluationSpatial Reasoning Benchmarks