VLM Evaluation

VLM: Vision-Language Model

Latest papers 658

All topics
CardsList
  1. What Drives Test-Time Adaptation for CLIP? A Controlled Empirical Study from an Update Perspective

    Jun 12, 2026Jiazhen Huang, Xiao Chen, Zhiming Liu +3VLM EvaluationTest-Time Adaptation

  2. Position: The Systemic Lack of Agency in Visual Reasoning

    Jun 11, 2026Yizhao Huang, Haoyang Chen, Shiqin Wang +6VLM EvaluationVLM Reasoning

  3. RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation

    Jun 11, 2026Dayu Xia, Yue Shi, Yao Mu +7VLM EvaluationRobotic Manipulation

  4. SalArt-VQA: Diagnosing Whether VLMs Understand Salient Artifacts in Generated Images

    Jun 10, 2026Ruotian Zhang, Xiaoxiao Sun, Junzhe Huang +2VLM EvaluationVLM Hallucination

  5. Task-Aligned Stability Analysis of Vision-Language Models for Autonomous Driving Hazard Detection

    Jun 10, 2026Everett RichardsVLM EvaluationVLM Robustness

  6. 4DP-QA: Scalable QA for 4D Perception in Vision Language Models

    Jun 10, 2026Seokju Cho, Abhishek Badki, Hang Su +5VLM EvaluationVLM Reasoning

  7. Towards Fully Automated Exam Grading: Fairness-Aware Recognition of Handwritten Answers with Foundation Models

    Jun 9, 2026Hartwig GrabowskiVLM EvaluationAlgorithmic Fairness

  8. Do VLMs Reason Like Engineers? A Benchmark and a Stage-wise Evaluation

    Jun 9, 2026Syed Wasiq, Syed Mohamad Tawseeq, Yashwant Pravinrao Bangde +1VLM EvaluationVisual Question Answering

  9. Do Vision-Language Models See or Guess? Measuring and Reducing Textual-Prior Reliance with a Phrasing-Controlled Benchmark

    Jun 9, 2026Pratham Singla, Shivank Garg, Vihan Singh +1VLM EvaluationVision-Language Models

  10. DB-3DME: From Dataset to Benchmark for Human-aligned Automatic 3D Mesh Evaluation

    Jun 8, 2026Nanshan Jia, Zhenyu Zhao, Junbo Peng +3VLM Evaluation3D VLMs

  11. A Controlled Audit of Pretraining Contamination in Public Medical Vision-Language Benchmarks

    Jun 8, 2026Bruce Changlong Xu, Lan Wu, Alexander RyuVLM EvaluationMedical VQA

  12. OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics

    Jun 8, 2026Mingxian Lin, Shengju Qian, Yuqi Liu +9VLM EvaluationGame-Playing Agents

  13. Guide Me Out: A Framework to Benchmark VLM Operators Communication in Crisis Scenarios

    Jun 8, 2026Giacomo Gonella, Stefano Menini, Marco GueriniVLM EvaluationDisaster Response

  14. Zero-Shot Semantic Re-Identification for Autonomous Driving: A VLM Baseline Study

    Jun 8, 2026Eduardo Borges, Manuel Abreu, Luís Garrote +1VLM EvaluationVision-Language Models

  15. ChinaHeritaQA: A Culturally-Grounded Visual Question Answering Dataset for World Heritage Sites in China

    Jun 8, 2026Yi Zhang, Bolei Ma, Yong Cao +3VLM EvaluationVisual Question Answering

  16. Are Reasoning Vision-Language Models Robust to Semantic Visual Distractions?

    Jun 8, 2026Yizheng Sun, Mochuan Zhan, Yanan Ma +10VLM EvaluationVLM Robustness

  17. Harnessing Streaming Video in the Wild

    Jun 7, 2026Dingyu Yao, Shuhuan Gu, Qingyi Si +8VLM EvaluationStreaming Video Understanding

  18. Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems

    Jun 6, 2026Muhammad Falensi Azmi, Ikhlasul Akmal Hanif, Vallerie Alexandra Putra +3VLM EvaluationVLM Robustness

  19. The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models

    Jun 5, 2026Lujun Li, Lama Sleem, Niccolo Gentile +4VLM EvaluationLarge Vision-Language Models

  20. MLingualFC: Evaluating Jailbreak Vulnerabilities in Multilingual Vision-Language Models

    Jun 5, 2026Rishabh Makwana, Mamta, Deeksha Varshney +1VLM EvaluationVLM Robustness

  21. Diagnosing Visual Ignorance in Vision-Language Models

    Jun 5, 2026Runyu Zhou, Qi Zhang, Yisen WangVLM EvaluationVLM Robustness

  22. Anchored, Not Graded: Vision-Language Models Fail at Slant-from-Texture Perception

    Jun 4, 2026Qian Zhang, Michal Golovanevsky, Fulvio Domini +1VLM EvaluationVision-Language Models

  23. Causal Scaffolding for Physical Reasoning: A Benchmark for Causally-Informed Physical World Understanding in VLMs

    Jun 4, 2026Tianyi Tang, Zhuoyi Lin, Zeyu Feng +4VLM EvaluationVLM Reasoning

  24. Cosine Misleads: Auxiliary Losses Reshape Vision Language Models, Not Their Latents

    Jun 4, 2026XiuYu Zhang, Junfeng Fang, Zhenkai LiangVLM EvaluationLatent Visual Reasoning