VLM Evaluation

VLM: Vision-Language Model

Latest papers 649

All topics
CardsList
  1. Auditing Data Leakage in Whole-Slide Image Multimodal Benchmarks

    Jul 14, 2026Wenhao Zhang, Zhongliang Zhou, John Kang +1VLM EvaluationData Leakage

  2. DynEval: Holistic Evaluations of T2I Generative Models in the Wild

    Jul 13, 2026Shyam Marjit, Dheeraj Baiju, Anuj Shikarkhane +3VLM EvaluationAutomated Evaluation

  3. 3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects

    Jul 12, 2026Zhenyu Zhao, Nanshan Jia, Jihyeon Je +7VLM Evaluation

  4. SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding

    Jul 11, 2026Abhigya Verma, Khyati Mahajan, Amit Kumar Saha +4VLM EvaluationVision-Language Models

  5. What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks

    Jul 11, 2026Guanhua Ye, Niu Jingbin, Yan Li +4VLM EvaluationVisual Question Answering

  6. Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models

    Jul 10, 2026Shravan Murlidaran, Miguel P. EcksteinVLM EvaluationImage Captioning

  7. OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents

    Jul 10, 2026Yang Chen, Yunwen Li, Yufan Shen +6VLM EvaluationDocument Understanding

  8. MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs

    Jul 9, 2026Hantao Zhang, Jinru Sui, Ed Li +2VLM EvaluationVision-Language Models

  9. AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding

    Jul 9, 2026Siddharth Damodharan, Radhika Gupta, Ali Alshami +2VLM EvaluationAutonomous Driving Benchmarks

  10. OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice

    Jul 9, 2026Qian Jiang, Zhecheng Shi, Jingpu Yang +2VLM EvaluationMedical VLMs

  11. Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

    Jul 9, 2026Matteo Santelmo, Xiuying Wei, Israa Fakih +5VLM EvaluationLLM Evaluation

  12. HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models

    Jul 8, 2026Feng He, Zhenting Wang, Qifan Wang +4VLM EvaluationVLM Hallucination

  13. Generalist Vision-Language Models for Fast Radio Burst detection: a zero-shot benchmark against a specialized detector

    Jul 8, 2026Raiff H. Santos, Amilcar R. Queiroz, Tharcisyo S. S. Duarte +2VLM EvaluationZero-Shot Learning

  14. Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks

    Jul 8, 2026Ethan Chung, Chuanjun Zheng, Jasper Tan +3VLM EvaluationAI Agent Benchmarks

  15. Comparative Study of Domain-adapted VLMs for General Document Visual Question Answering

    Jul 8, 2026Miguel Lopez-Duran, Elena Marrero, Julian Fierrez +8VLM EvaluationDocument Understanding

  16. UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation

    Jul 7, 2026Grace Man Chen, Litao Guo, Yifan Wu +5VLM EvaluationWeb Application Generation

  17. VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection

    Jul 7, 2026Sharayu N. Deshmukh, Md Rashidunnabi, Nelton Tiago Gemo +3VLM EvaluationDeepfake Detection

  18. SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments

    Jul 6, 2026Suryanarayana Reddy Yarrabothula, Manisha Chawla, Kunal Sinha +5VLM EvaluationVideo Understanding

  19. Does It Fail to See or Fail to Know? Attributing Errors in Vision-Language Models

    Jul 6, 2026Khang Nhat Hoang Vo, Artem Vazhentsev, Artem Shelmanov +2VLM EvaluationVision-Language Models

  20. RoboVista: Evaluating Vision Language Models for Diverse Robot Applications

    Jul 6, 2026Shuangyu Xie, Kaiyuan Chen, Ziyang Chen +8VLM EvaluationEmbodied QA

  21. HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding

    Jul 5, 2026Yinsheng Yao, Yan Liu, Chen YeVLM EvaluationLarge Vision-Language Models

  22. When Simpler Is Better: Evaluating Translation Pipelines for Medieval Latin Manuscripts

    Jul 4, 2026Nguyen Kim Hai Bui, Md. Easin Arafat, Tamás Gábor Orosz +1VLM EvaluationLow-Resource MT

  23. ClinOCR-Bench: A Comprehensive Clinical Scanned Document Dataset for Optical Character Recognition Model Evaluation

    Jul 4, 2026Enshuo Hsu, Jin Zhou, Kirk RobertsVLM EvaluationOptical Character Recognition

  24. Do Medical Vision Language Models Actually See? A Counterfactual Grounding Framework and Hard-Negative Contrastive Training for Visually-Reliant Medical VLMs

    Jul 4, 2026Anas Zafar, Leema Krishna Murali, Siddhant Bharadwaj +2VLM EvaluationCounterfactual Evaluation

  25. IDEAL-Bench: Indoor Dataset and Evaluation suite for Analyzing 3D Layout reasoning

    Jul 3, 2026Yuening Cai, Junwei Zhou, Youran Qu +1VLM EvaluationSpatial Reasoning Benchmarks