VLM Evaluation

VLM: Vision-Language Model

Latest papers 658

All topics
CardsList
  1. PlanBench-V: A Spatial Planning Map Benchmark for Vision-Language Models

    Jun 4, 2026Minxin Chen, He Zhu, Junyou Su +3VLM EvaluationSpatial Reasoning Benchmarks

  2. Seeing Time: Benchmarking Chronological Reasoning and Shortcut Biases in Vision-Language Models

    Jun 4, 2026Haoyu Zhou, Qing Qing, Caichong Li +6VLM EvaluationVision-Language Models

  3. UltraVR: A Diagnostic Ultra-Resolution Image-VQA Benchmark for Evidence-Grounded Reasoning

    Jun 4, 2026Gexin Huang, Yanting Yang, Myeongkyun Kang +6VLM EvaluationVisual Question Answering

  4. Almieyar-Oryx-BloomBench: A Bilingual Multimodal Benchmark for Cognitively Informed Evaluation of Vision-Language Models

    Jun 4, 2026Mohammad Mahdi Abootorabi, Omid Ghahroodi, Anas Madkoor +4VLM EvaluationMultilingual VLM Evaluation

  5. Would you still call this Dax? Novel Visual References in VLMs and Humans

    Jun 3, 2026Ada Defne Tür, Gaurav Kamath, Joyce Chai +2VLM EvaluationVision-Language Models

  6. NoRA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning

    Jun 3, 2026Sichao Li, Sai Ma, Daniel Kilov +3VLM EvaluationMoral Reasoning in Language Models

  7. NextMotionQA: Benchmarking and Judging Human Motion Understanding with Vision-Language Models

    Jun 3, 2026Yong Cao, Chuqiao Li, Xianghui Xie +2VLM EvaluationTemporal Video Understanding

  8. Beyond Symmetric Alignment: Spectral Diagnostics of Modality Imbalance in Vision-Language Models in the Medical Domain

    Jun 3, 2026Alessandro Gambetti, Qiwei Han, Cláudia Soares +1VLM EvaluationModality Imbalance

  9. VCIFBench: Evaluating Complex Instruction Following for Video Understanding

    Jun 3, 2026Huangchen Xu, Yuan Wu, Yi ChangVLM EvaluationVideo Understanding

  10. A Dataset for Dynamic Human Preferences for Vision Language Models

    Jun 2, 2026Hannah Gao, Dylan Hadfield-Menell, Rachel MaVLM EvaluationHuman Preference Evaluation

  11. NewtPhys: Do Foundation Models Understand Newtonian Physics?

    Jun 2, 2026Sebastian Cavada, Soumava Paul, Tuan-Hung Vu +2VLM EvaluationScientific Reasoning

  12. Beyond Encoder Accumulation: Measuring Encoder Roles in Multi-Encoder VLMs

    Jun 2, 2026Wei Ding, Yudong Zhang, Ruobing Xie +3VLM EvaluationVision-Language Models

  13. Does Language Shift Break Medical Vision-Language Models? Indonesian Radiology Visual Question Answering Case Study

    Jun 2, 2026Pieter Christy Yan Yudhistira, Dzaki Rafif Malik, Novanto YudistiraVLM EvaluationVLM Robustness

  14. VidMsg: A Benchmark for Implicit Message Inference in Short Videos

    Jun 2, 2026Issar Tzachor, Michael Green, Rami Ben-AriVLM EvaluationVideo QA

  15. TurtleAI: Benchmarking Multimodal Models for Visual Programming in Turtle Graphics

    Jun 2, 2026Chao Wen, Jacqueline Staub, Adish SinglaVLM EvaluationLLM-Based Program Synthesis

  16. Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching

    Jun 2, 2026Hao Zhong, Muzhi Zhu, Shenyan Zeng +8VLM EvaluationSpatial Reasoning Benchmarks

  17. Enginuity: A Dataset and Benchmark for Vision-Language Understanding of Engineering Diagrams

    Jun 2, 2026Abhishek Kumar, Isha Motiyani, Tilak Kasturi +3VLM EvaluationVisual Question Answering

  18. VistaHop: Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch

    Jun 2, 2026Hang He, Chuhuai Yue, Chengqi Dong +6VLM EvaluationVisual Question Answering

  19. Disentangling Visual and Factual Correctness in LVLMs' Visualization Literacy

    Jun 2, 2026Soohyun Lee, Jaeyoung Kim, Seokhyeon Park +5VLM EvaluationData Visualization

  20. Automated Report-Derived Oncology VQA Benchmark for Evaluating Vision-Language Models on 3D Medical Imaging

    Jun 1, 2026Bo Liu, Hanxue Gu, Xiangru Li +6VLM EvaluationMedical Imaging

  21. Do VLMs See What Sensors Feel? A Scalable Expert-Guided Design for Wheelchair Accessibility Assessment from Street View

    Jun 1, 2026Dongdong Wang, Alina Hagen, Isabelle Gatmaitan +5VLM EvaluationVision-Language Models

  22. GeoDrive-Bench: Benchmarking Region-Specific Multimodal Reasoning in Autonomous Driving

    Jun 1, 2026Yingzi Ma, Chaowei Xiao, Ming JiangVLM EvaluationAutonomous Driving Benchmarks

  23. Consistent Yet Wrong: Evidence Insensitivity in Spatial Vision-Language Models

    Jun 1, 2026S Divakar Bhat, Toshihiko YamasakiVLM EvaluationMulti-View Consistency

  24. Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events

    Jun 1, 2026Xiaolin Liu, Yilun Zhu, Xiangyu Zhao +9VLM EvaluationVideo QA

  25. FATE-VLA:Failue-aware test generation for vision-language-action models

    Jun 1, 2026Arusa Kanwal, Pablo Valle, Shaukat Ali +1VLM EvaluationVision-Language-Action Models

  26. Readable Yet Unpredictable: Rotated-Outcome Prediction in Vision-Language Models

    Jun 1, 2026Lexin Wang, Shenghua Liu, Yiwei Wang +2VLM EvaluationVLM Reasoning

  27. Vision-language Models for Driver Monitoring Systems: A Driver Activity Description Dataset

    Jun 1, 2026David J. Lerch, Sarath Mulugurthi, Manuel Martin +2VLM EvaluationVLM Adaptation

  28. InsightVQA: High-Dimensional Emotion-Cognitive Visual Question Answering Benchmark

    Jun 1, 2026Shiyu Wang, Ziyu Liu, Chaoyi Yu +6VLM EvaluationVisual Question Answering