VLM Evaluation

VLM: Vision-Language Model

Latest papers 649

All topics
CardsList
  1. What Matters for Grocery Product Retrieval with Open Source Vision Language Models

    May 18, 2026Emmanuel G. Maminta, Rowel O. AtienzaVLM EvaluationFine-Grained Image Retrieval

  2. SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning

    May 18, 2026Xiao Yang, Ronghao Fu, Zhiwen Lin +10VLM EvaluationVLM Robustness

  3. CounterCount: A Diagnostic Framework for Counting Bias in Vision Language Models

    May 18, 2026Reem Alzahrani, Hassan Alshanqiti, Bushra Bin Hemid +3VLM EvaluationVision-Language Models

  4. AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment

    May 17, 2026Kuei-Chun Kao, Daixuan Huo, Yuanhao Ban +1VLM EvaluationRubric-Based Evaluation

  5. Employing Vision-Language Models for Face Image Quality Assessment

    May 17, 2026Erdi Sarıtaş, Eren Onaran, Vitomir Štruc +1VLM EvaluationVLM Robustness

  6. Medical Context Distorts Decisions in Clinical Vision Language Models

    May 17, 2026David Restrepo, Ira Ktena, Maria Vakalopoulou +2VLM EvaluationVLM Robustness

  7. UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation

    May 16, 2026Shiv Ghosh, Junayd Lateef, Chih-Hua Liu +3VLM EvaluationMedical VQA

  8. EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models

    May 16, 2026Haozhe Shan, Xiancong Ren, Han Dong +9VLM EvaluationVision-Language Grounding

  9. Can Vision Language Models Be Adaptive in Mathematics Education? A Learner Model-based Rubric Study

    May 15, 2026Jie Gao, Yongan Yu, Junzhu Su +3VLM EvaluationIntelligent Tutoring Systems

  10. Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination

    May 15, 2026Chufan Shi, Cheng Yang, Yaokang Wu +4VLM EvaluationVLM Robustness

  11. VCG-Bench: Towards A Unified Visual-Centric Benchmark for Structured Generation and Editing

    May 15, 2026Xiaoyan Su, Peijie Dong, Zhenheng Tang +8VLM EvaluationCode Generation

  12. VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following

    May 15, 2026Hyesoo Hong, Minsoo Kim, Wonje Jeung +3VLM EvaluationVisual Navigation

  13. MI-CXR: A Benchmark for Longitudinal Reasoning over Multi-Interval Chest X-rays

    May 15, 2026Sunghwan Steve Cho, Yunseok Han, Jaeyoung DoVLM EvaluationHealthcare

  14. On the Cultural Anachronism and Temporal Reasoning in Vision Language Models

    May 14, 2026Mukul Ranjan, Prince Jha, Khushboo Kumari +1VLM EvaluationVLM Reasoning

  15. MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models

    May 14, 2026Xiyu Ren, Zhaowei Wang, Yiming Du +11VLM EvaluationMemory-Augmented VLMs

  16. Exploring Vision-Language Models for Online Signature Verification: A Zero-Shot Capability Study

    May 14, 2026Marta Robledo-Moreno, Ruben Vera-Rodriguez, Ruben Tolosana +1VLM EvaluationZero-Shot Learning

  17. SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization

    May 14, 2026Posheng Chen, Powen Cheng, Gueter Josmy Faure +2VLM EvaluationVisual Spatial Reasoning

  18. CurveBench: A Benchmark for Exact Topological Reasoning over Nested Jordan Curves

    May 13, 2026Amirreza Mohseni, Mona Mohammadi, Morteza Saghafian +1VLM EvaluationSpatial Reasoning Benchmarks

  19. FIKA-Bench: From Fine-grained Recognition to Fine-Grained Knowledge Acquisition

    May 13, 2026Geng Li, Yuxin PengVLM EvaluationFine-Grained Visual Perception

  20. Revealing the Gap in Human and VLM Scene Perception through Counterfactual Semantic Saliency

    May 13, 2026Ziqi Wen, Parsa Madinei, Miguel P. EcksteinVLM EvaluationVision-Language Models

  21. CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence

    May 13, 2026Dongsheng Ma, Jiayu Li, Zhengren Wang +9VLM EvaluationCitation Verification

  22. UHR-Micro: Diagnosing and Mitigating the Resolution Illusion in Earth Observation VLMs

    May 12, 2026Shuo Ni, Tong Wang, Jing Zhang +5VLM EvaluationRemote Sensing Image Understanding

  23. Chronicles-OCR: A Cross-Temporal Perception Benchmark for the Evolutionary Trajectory of Chinese Characters

    May 12, 2026Gengluo Li, Shangpin Peng, Xingyu Wan +16VLM EvaluationVLM Robustness

  24. Unlocking UML Class Diagram Understanding in Vision Language Models

    May 12, 2026Artem Naboichenko, René PeinlVLM EvaluationVisual Question Answering

  25. Vision2Code: A Multi-Domain Benchmark for Evaluating Image-to-Code Generation

    May 11, 2026Ajay Vikram Periasami, Junlin Wang, Bhuwan DhingraVLM EvaluationCode Generation

  26. Do Vision-Language-Models show human-like logical problem-solving capability in point and click puzzle games?

    May 11, 2026Maximilian Triebel, Marco Menner, Dominik HelfensteinVLM EvaluationPhysical Reasoning

  27. Grounded or Guessing? LVLM Confidence Estimation via Blind-Image Contrastive Ranking

    May 11, 2026Reza Khanmohammadi, Erfan Miahi, Simerjot Kaur +4VLM EvaluationVision-Language Models

  28. Verification Mirage: Mapping the Reliability Boundary of Self-Verification in Medical VQA

    May 11, 2026Ruinan Jin, Beidi Zhao, Myeongkyun Kang +2VLM EvaluationVision-Language Models