VLM Evaluation

VLM: Vision-Language Model

Latest papers 658

All topics
CardsList
  1. A Structured Benchmark for Text-Guided Anomaly Detection: When Language Stops Conditioning the Decision

    Jun 1, 2026Stefano Samele, Eugenio Lomurno, Teodora Jovanovic +3VLM EvaluationIndustrial Anomaly Detection

  2. The Image Reconstruction Game: Drawing Common Ground Through Iterative Multimodal Dialogue

    Jun 1, 2026Sherzod Hakimov, Mattia D'Agostini, Ivan Samodelkin +1VLM EvaluationMultimodal Grounding

  3. What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs

    Jun 1, 2026Abhishek Aich, Sparsh Garg, Vijay Kumar BG +2VLM EvaluationVLMs for Autonomous Driving

  4. Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing

    May 31, 2026Minglai Yang, Xinyan Velocity Yu, Pengyuan Li +22VLM EvaluationDocument Parsing

  5. ChartArena: Benchmarking Chart Parsing across Languages, Scenarios, and Formats

    May 31, 2026Shangpin Peng, Gengluo Li, Xingyu Wan +10VLM EvaluationData Visualization

  6. Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning

    May 31, 2026Garvin Guo, Yu Chen, Xiang Wang +4VLM EvaluationVLM Interpretability

  7. TECCI: Tricky Edits of Collected and Curated Images

    May 31, 2026Aishwarya Agrawal, Roy Hirsch, Yasumasa Onoe +2VLM EvaluationImage Editing Evaluation

  8. HakushoBench: A Japanese Chart and Table VQA Benchmark from Governmental White Papers

    May 31, 2026Issa Sugiura, Shuhei Kurita, Yusuke Oda +1VLM EvaluationData Visualization

  9. 3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code

    May 31, 2026Yipeng Gao, Lei Shu, Genzhi Ye +5VLM Evaluation3D Asset Generation

  10. Benchmarks for Vision-Language Models in Urban Perception Should Be Reliability-Aware and Negotiated

    May 30, 2026Rashid MushkaniVLM EvaluationInter-Rater Reliability

  11. RoboStressBench: Benchmarking VLM Robustness to Physical Visual Stress in Embodied Scenes

    May 30, 2026Leyi Wu, Yifan Zhao, Jinjie Zhang +11VLM EvaluationVLM Robustness

  12. An Attribute-Based Measure of Video Complexity

    May 30, 2026Aditya Sarkar, Yi Li, Zihao Wang +6VLM EvaluationVideo QA

  13. Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs

    May 30, 2026Mona Gandhi, KJ Joseph, Srinivasan Parthasarathy +1VLM EvaluationVLM Interpretability

  14. SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models

    May 29, 2026Olaf Dünkel, Basavaraj Sunagad, Haoran Wang +3VLM EvaluationSemantic Correspondence

  15. EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision

    May 29, 2026Rosario Forte, Giuseppe Lando, Antonino FurnariVLM EvaluationStreaming Video Understanding

  16. Vision-Language Models Suppress Female Representations Under Ambiguous Input

    May 29, 2026Arnau Marin-Llobet, Simon Henniger, Mahzarin R. BanajiVLM EvaluationVLM Interpretability

  17. Can You Trust What You See? Human and AI Detection of Synthetic Legal Evidence

    May 29, 2026Jinzhe Tan, Ali Ekber Cinar, Karim BenyekhlefVLM EvaluationAI-Generated Image Detection

  18. "Înţelegi Româneşte?'' A Recipe for Romanian Vision-Language Models

    May 29, 2026Mihai Masala, Marius Leordeanu, Mihai Dascalu +1VLM EvaluationVision-Language Models

  19. A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation

    May 29, 2026Yi Zhao, Siqi Wang, Zhe Hu +2VLM EvaluationLLM-as-a-Judge

  20. FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection

    May 29, 2026Paramananda Bhaskar, Naquee Rizwan, Daksh Jogchand +2VLM EvaluationVLM Adaptation

  21. Can Aerial VLA Models Cooperate? Evaluating Closed-Loop Air-Ground Coordination with CARLA-Air

    May 29, 2026Tianle Zeng, Yanci Wen, Xueang Yu +1VLM EvaluationAerial Robotics

  22. Does Visual Information Play a Decisive Role in Vision-Language-Action Model Driving Behavior?

    May 29, 2026Jingtao He, Hongliang Lu, Xiaoyun Qiu +2VLM EvaluationAutonomous Driving

  23. What Makes LVLMs Hallucinate Less? Unveiling the Architectural Factors Behind Hallucination Robustness

    May 29, 2026Yusheng He, Jizhe Zhou, Xia Du +3VLM EvaluationVLM Robustness

  24. StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning

    May 29, 2026Xixiang He, Baiqi Wu, Xingming Li +4VLM EvaluationVisual Reasoning

  25. Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models

    May 29, 2026Yijie Tong, Yifan Hou, Shaobo Cui +2VLM EvaluationVision-Language Models

  26. Why Far Looks Up: Probing Spatial Representation in Vision-Language Models

    May 28, 2026Cheolhong Min, Jaeyun Jung, Daeun Lee +5VLM EvaluationSpatial Reasoning Benchmarks

  27. Comparative Evaluation of Machine Translation Systems on Images with Text

    May 28, 2026Blai Puchol, Sergio Gómez González, Miguel Domingo +1VLM EvaluationMachine Translation