VLM Evaluation

VLM: Vision-Language Model

Latest papers 649

All topics
CardsList
  1. Lost in Translation: Do LVLM Judges Generalize Across Languages?

    Apr 21, 2026Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem +5VLM EvaluationMultilingual VLM Evaluation

  2. Disparities In Negation Understanding Across Languages In Vision-Language Models

    Apr 21, 2026Charikleia Moraitaki, Sarah Pan, Skyler Pulling +3VLM EvaluationVision-Language Models

  3. LLM-as-Judge Framework for Evaluating Tone-Induced Hallucination in Vision-Language Models

    Apr 20, 2026Zhiyuan Jiang, Weihao Hong, Xinlei Guan +8VLM EvaluationHallucination Detection in VLMs

  4. Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models

    Apr 20, 2026Yakoub Bazi, Mohamad M. Al Rahhal, Mansour Zuair +1VLM EvaluationRemote Sensing Image Understanding

  5. Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models

    Apr 20, 2026Haiweng Xu, Sipeng Zheng, Hao Luo +3VLM EvaluationVLM Reasoning

  6. Leveraging Vision-Language Models to Detect Attention in Educational Videos

    Apr 20, 2026Gabriel Becquet, Sébastien Lallé, Vanda Luengo +1VLM EvaluationEducational Technology

  7. Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models

    Apr 20, 2026Ziyao Tang, Pengkun Jiao, Bin Zhu +3VLM EvaluationVLM Robustness

  8. When Vision-Language Models Judge Without Seeing: Exposing Informativeness Bias

    Apr 20, 2026Xiaohan Zou, Roshan Sridhar, Mohammadtaher Safarzadeh +1VLM EvaluationVision-Language Alignment

  9. Lost in Motion: Vision Language Models Fail the Dynamic Gauges Test

    Apr 19, 2026Tairan Fu, Francisco Javier Santos-Martín, Javier Conde +2VLM EvaluationIndustrial Inspection

  10. When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models

    Apr 19, 2026Cui Yakun, Xingqun Qi, TianTian Geng +3VLM EvaluationVLM Hallucination

  11. DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models

    Apr 18, 2026JiYang Wang, Jiawei Chen, Mengqi Xiao +3VLM EvaluationHallucination Detection in VLMs

  12. Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization

    Apr 17, 2026Siddhant Bharadwaj, Ashish Vashist, Fahimul Aleem +1VLM EvaluationLarge Vision-Language Models

  13. HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning

    Apr 17, 2026Yanbin Wei, Chun Kang, Siwei Li +11VLM EvaluationLarge Vision-Language Models

  14. Why Do Vision Language Models Struggle To Recognize Human Emotions?

    Apr 16, 2026Madhav Agarwal, Sotirios A. Tsaftaris, Laura Sevilla-Lara +1VLM EvaluationMultimodal Emotion Recognition

  15. MetaDent: Labeling Clinical Images for Vision-Language Models in Dentistry

    Apr 16, 2026Meng-Xun Li, Wen-Hui Deng, Zhi-Xing Wu +6VLM EvaluationMedical Image Analysis

  16. GUI-Perturbed: Domain Randomization Reveals Systematic Brittleness in GUI Grounding Models

    Apr 15, 2026Yangyue Wang, Harshvardhan Sikka, Yash Mathur +3VLM EvaluationDomain Randomization

  17. Confidence under Visual Token Pruning: Removed Evidence and Risk-Controlled Token Budgets for MLLMs

    Apr 13, 2026Kaizhen Tan, Yang Feng, Heqing Du +3VLM EvaluationConfidence Estimation in Language Models

  18. RefGlitch-Bench: A Benchmark for Reference-based Gameplay Glitch Detection with Vision-Language Models

    Apr 13, 2026Yakun Yu, Ashley Wiens, Adrián Barahona-Ríos +4VLM EvaluationVideo Anomaly Detection

  19. Cross-Cultural Value Attribution in Large Vision-Language Models

    Apr 10, 2026Phillip Howard, Xin Su, Kathleen C. FraserVLM EvaluationCounterfactual Evaluation of VLMs

  20. TSHA: A Benchmark for Visual Language Models in Trustworthy Safety Hazard Assessment Scenarios

    Mar 31, 2026Qiucheng Yu, Ruijie Xu, Mingang Chen +2VLM EvaluationVLM Robustness

  21. Video-Oasis: Rethinking Evaluation of Video Understanding

    Mar 31, 2026Geuntaek Lim, Sungjune Park, Jaeyun Lee +5VLM EvaluationTemporal Video Understanding

  22. Rethinking Visual Privacy: A Compositional Privacy Risk Framework for Severity Assessment with VLMs

    Mar 23, 2026Efthymios Tsaprazlis, Tiantian Feng, Anil Ramakrishna +3VLM EvaluationPrivacy Auditing

  23. CREG: Compass Relational Evidence Graph for Characterizing Directional Structure in VLM Spatial-Reasoning Attribution

    Mar 20, 2026Kaizhen Tan, Yang Feng, Heqing DuVLM EvaluationGradient-Based Attribution

  24. Do Vision Language Models Understand Human Engagement in Games?

    Mar 19, 2026Ziyi Wang, Qizan Guo, Rishitosh Singh +1VLM EvaluationVideo-Language Models

  25. GroundSet: A Cadastral-Grounded Dataset for Spatial Understanding with Vector Data

    Mar 15, 2026Roger Ferrod, Maël Lecene, Krishna Sapkota +4VLM EvaluationRemote Sensing Image Understanding

  26. vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models

    Mar 14, 2026Suhwan Choi, Yunsung Lee, Yubeen Park +4VLM EvaluationVision-Language-Action Models