VLM Evaluation

VLM: Vision-Language Model

Latest papers 649

All topics
CardsList
  1. MUSE: Benchmarking Large Vision-Language Models on Multi-Modal Understanding in Situated Education

    Sep 16, 2026Luyao Zhu, Xun Wei Yee, Wei Li +2VLM EvaluationLarge Vision-Language Models

  2. Decodable but Misrouted: Sparse Features Uncover a Readout Gap in Vision-Language Models for Harmful Meme Detection

    Sep 16, 2026Girish A. Koushik, Diptesh Kanojia, Helen TreharneVLM EvaluationVLM Robustness

  3. The Mirage of Calibrated Confidence: Trajectory-Independence of Verbalized Confidence in Vision-Language Models

    Sep 16, 2026Jisoo Yang, Jaeho Han, Trung X. Pham +1VLM EvaluationConfidence Estimation in Language Models

  4. EDCT-Bench: Uncovering Faithfulness Gaps in VLMs via Explanation-Driven Counterfactual Testing

    Sep 16, 2026Sihao Ding, Santosh Vasa, Aditi Ramadwar +1VLM EvaluationVLM Robustness

  5. Can VLMs Reliably Assess Sidewalk Accessibility Attributes from Pedestrian-Level Imagery?

    Sep 15, 2026Seung Jae Lieu, Diego Morra, Chiara Cadoni +3VLM EvaluationUrban Planning

  6. Vroom-Vroom at SHROOM-Visions: A Multi-Judge Committee for Detecting Hallucinated Spans in Vision-Language Outputs

    Sep 15, 2026Toqeer Ehsan, Nico Penttilä, Richard Schmidt +2VLM EvaluationHallucination Detection in VLMs

  7. Symmetry-Aware Likelihood-Orbit Aggregation for Selective Left-Right Claim Verification

    Sep 15, 2026Zhouzhi Xiong, Chuxi Zhang, Weizhen He +3VLM EvaluationVisual Spatial Reasoning

  8. Beyond Accuracy: Robustness, Cost, and Governance Trade-offs for Vision-Language Models in Templated Document Extraction

    Sep 14, 2026Kushal Patel, Pushkal Shrivastava, Mackenzie Lees +4VLM EvaluationVLM Robustness

  9. ModaLens: Measuring Image Sensitivity in Report-Conditioned Medical VLMs

    Sep 14, 2026Sebastián Andrés Cajas Ordóñez, Maximin Lange, Quang Bui +9VLM EvaluationRadiology VLMs

  10. New Evidence, Same Choice: Testing Physical Experiment Selection in Vision Language Models

    Sep 12, 2026Sourajit Saha, Shubhashis Roy Dipta, Nobin Sarwar +4VLM EvaluationVLM Reasoning

  11. Can Edge-Deployable Vision-Language Models Identify Species?

    Sep 12, 2026William Zhou, Mayukha Siripuram, Xiao Yan +2VLM EvaluationVLM Robustness

  12. VANTAGE-Bench: Evaluating the Infrastructure AI Gap in Vision-Language Models

    Sep 10, 2026Zaid Pervaiz Bhat, Nimra Nayyar, Arihant Jain +6VLM EvaluationVision-Language Models

  13. Spot-the-shift: Evaluating Grounded Image Difference Captioning of Long-term Changes

    Sep 9, 2026Benedetta Liberatori, Nermin Samet, Paolo Rota +4VLM EvaluationAutonomous Driving Benchmarks

  14. LogiScope-VQA: Benchmarking Vision-Language Models for Logistics Hazard Identification in Industrial Scenarios

    Sep 9, 2026Hanjing Zhou, Mingze Yin, Ying Lian +3VLM EvaluationVisual Question Answering

  15. Charts Are Beyond Pixels: Probing for Layer-Wise Chart Understanding and Editing

    Sep 8, 2026Xiaochuan Zhong, Yifan Hou, Chenxi Pang +1VLM EvaluationChart QA

  16. Human-Centric Image Captioning with Subject-Centered Spatial Understanding

    Sep 8, 2026Bozhou Li, Jiahang Zhang, Yue Ding +11VLM EvaluationImage Captioning

  17. VI-Bench: Benchmarking Prompt Inversion from AIGC Videos

    Sep 8, 2026Wulin Xie, Rui Zhao, Kecen Li +5VLM EvaluationVideo Generation Evaluation

  18. Principia: Relational Physics Tests for Video Models

    Sep 3, 2026Varun Varma Thozhiyoor, Shivam Tripathi, Venkatesh Babu Radhakrishnan +1VLM EvaluationPhysical Consistency in Video Generation

  19. SVG-Score: Human-Aligned Evaluation of Text-to-SVG Generation

    Sep 3, 2026Marco Cipriano, Leonardo Zini, Alexandra Schild +5VLM EvaluationHuman Preference Modeling

  20. FailBench: How Reliable are VLMs at Judging Robot Task Success?

    Sep 3, 2026Zaruhi Navasardyan, Tatul Danielyan, Hrant DavtyanVLM EvaluationRobot Failure Detection

  21. FPCO-Dialog: A Multi-Turn False-Premise Benchmark for Correction and Cooperation in Vision-Language Models

    Sep 3, 2026Jiayuan Ma, Yuqi Lu, Weiyang Guo +5VLM Evaluation

  22. Who Drives the Probability Game of VLMs? A Temporal Causal Drive Evaluation Framework

    Sep 2, 2026Shuyao Xiao, Shengling Wang, Haoyu Niu +4VLM EvaluationVLM Interpretability