VLM Evaluation

VLM: Vision-Language Model

Latest papers 649

All topics
CardsList
  1. Evaluating VLMs for Autonomous Agent-Driven Geometry Clipping Detection in Video Game QA

    Jul 28, 2026Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos +2VLM EvaluationVLM Robustness

  2. ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams

    Jul 27, 2026Ali Ansari, Yasmin Mohammadi, Farnoush Nili +3VLM EvaluationDocument Image Understanding

  3. When Low CER is Not Enough: An Analysis of Hallucinations in Vision-Language OCR Systems on Historical Uruguayan Documents

    Jul 27, 2026Marina Gardella, Camilo Mariño, Diego Belzarena +3VLM EvaluationVLM Hallucination

  4. Cheap Probes Predict Expensive Training in 3D-CT Vision--Language Models

    Jul 24, 2026Renjie LiangVLM EvaluationMedical VLMs

  5. Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints

    Jul 23, 2026Liqiang Jing, Xiong Zhou, Siddharth Varia +3VLM EvaluationVisual Reasoning

  6. CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA

    Jul 23, 2026Hanseok Oh, Parishad BehnamGhader, Benno Krojer +4VLM EvaluationMultimodal RAG

  7. V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure

    Jul 23, 2026Zhetong Zhang, Honghao Fu, Miao Xu +2VLM EvaluationVLM Robustness

  8. Do Pathology Vision-Language Models Truly See Pathology?

    Jul 23, 2026Chengyang Zhang, Wenchuan Zhang, Bo Li +10VLM EvaluationComputational Pathology

  9. MVEI & EmObserver: Empowering MLLM-Oriented Visual Emotional Intelligence via Emotion Statement Judgement

    Jul 23, 2026Daiqing Wu, Dongbao Yang, Jiashu Yao +4VLM EvaluationMultimodal Emotion Recognition

  10. ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?

    Jul 23, 2026Han Li, Si Liu, Zehao Huang +6VLM EvaluationSpatial Reasoning Benchmarks

  11. ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models

    Jul 22, 2026Karan Goyal, Afreen Hossain, Debojyoti Das +1VLM EvaluationVision-Language Models

  12. PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image

    Jul 21, 2026Dankai Liao, Tianyi Zhang, Yufeng Wu +6VLM EvaluationMedical VLMs

  13. Bounding Boxes to Improve Small Language Model Performance on Vision-Based Grading Tasks

    Jul 21, 2026Lachlan McGinnessVLM EvaluationEducational Assessment

  14. MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts

    Jul 21, 2026Wenqi Marshall Guo, Qingyun Qian, Shiyu Zhou +2VLM EvaluationObject Hallucination in VLMs

  15. Attention Without Grounding: Causal Evaluation of Visual Explanations in Medical VLMs

    Jul 20, 2026Binesh Sadanandan, Vahid BehzadanVLM EvaluationVLM Interpretability

  16. The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric

    Jul 20, 2026Sheng-Yu Wang, Yotam Nitzan, Aaron Hertzmann +4VLM EvaluationT2I Generation Evaluation

  17. Measuring and Improving Complex-Atomic Answer Consistency in Endoscopic VQA

    Jul 20, 2026Yuhao Liu, Cheng Zhao, Guanghui YueVLM EvaluationEndoscopy

  18. Hazard or Anomaly? Evaluating VLMs for Understanding Dangers and Discrepancies

    Jul 18, 2026Murali Indukuri, Mohammad Eskandari, Sree Nitya Kollu +2VLM Evaluation

  19. An Exam for Active Observers

    Jul 17, 2026Jiarui Zhang, Muzi Tao, Shangshang Wang +3VLM EvaluationMultimodal Large Language Models

  20. Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling

    Jul 17, 2026Bo-An Chang, Yu-Chih ChenVLM EvaluationReward Modeling

  21. AI vs Human Expert Reasoning: Assessing Agreements in Building Typology Predictions based on Street View Imagery

    Jul 16, 2026Zahratu Shabrina, Muhammad Asa, Jin Rui +2VLM EvaluationVLM Reasoning

  22. VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

    Jul 16, 2026Yunfeng Liu, Yuandong Yang, Jiarui Han +5VLM EvaluationVideo Understanding

  23. SportD: How do VLMs physically strategize?

    Jul 16, 2026Jasin Cekinmez, Addison J. Wu, Haotian Xia +6VLM EvaluationVision-Language Models

  24. Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions

    Jul 16, 2026Yijiang Li, Huiqi Zou, Bingyang Wang +1VLM EvaluationVLM Hallucination

  25. Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks

    Jul 14, 2026Jae Joong LeeVLM EvaluationVideo-Language Model Evaluation

  26. CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models

    Jul 14, 2026Lin Peng, Cong Wan, Zeyu Guo +2VLM EvaluationVisual Reasoning

  27. Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction

    Jul 14, 2026Sukriti Tiwari, BHVSP Subrahmanyam, Nidhi Goyal +1VLM EvaluationEEG-Based Visual Decoding