VLM Evaluation

VLM: Vision-Language Model

Latest papers 649

All topics
CardsList
  1. MedBenchAgent: Towards Systematic Automation of Medical VLM Benchmark Construction

    Oct 8, 2026Yulin Fu, Junren Wang, Guangjing Yang +5Medical Image BenchmarksVLM Evaluation

  2. Understanding and Mitigating Token-Pruning-Induced Vulnerabilities in VLMs

    Oct 7, 2026Shuailong Wang, Xinyu Lyu, Shengming Yuan +3Visual Token PruningVLM Robustness

  3. Visual Evidence Under Cross-Examination: Evaluating and Controlling Decision-Level Evidence Use in Vision-Language Models

    Oct 7, 2026Huiyao Zhang, Jin Bai, Zilong Su +6VLM EvaluationFaithfulness in VLMs

  4. ScribbleEdit: A Benchmark for Scribble-Only Image Editing

    Oct 7, 2026Jie Ren, Hao Kang, Kai Guo +9Image EditingImage Editing Evaluation

  5. Visual Orchestration Tax in Agentic VLM Pipelines: Auditing and Certifying Visual Evidence Reuse

    Oct 6, 2026Lingteng ZengVLM EvaluationAI Agent Auditing

  6. The Failure Is in the Readout: Fine-Grained Emotion Recognition Benchmarks Measure Elicitation, Not Perception

    Oct 6, 2026Tobias Hallmen, Fabian Deuser, Robin-Nico Kampa +2VLM EvaluationFacial Expression Recognition

  7. BrainTRACE: Tracing Longitudinal, Multimodal, and Volumetric Evidence in Brain MRI Clinical Reasoning

    Oct 5, 2026Qizhen Lan, Mengchen Fan, Hang Zhang +5VLM Evaluation3D Medical Imaging

  8. SpatialChain: A Benchmark for Auditing Spatial Reasoning Faithfulness in VLMs

    Oct 5, 2026Rafael Teixeira Sousa, Vinícius Paulo Lopes de Oliveira, Elisa Ayumi Masasi de Oliveira +5VLM EvaluationSpatial Reasoning Benchmarks

  9. Readout Blindness: VLM Scores Miss the Spatial Direction Their Frozen Encoders Retain

    Oct 5, 2026Guangyuan Li, Tianming Du, Yan Jiang +2VLM EvaluationVision-Language Grounding

  10. Rotated, but How Far? Diagnosing and Improving Object-Rotation Reasoning in VLMs

    Oct 5, 2026Zhaochen Wang, Yujun Cai, Huangbo Zou +4VLM EvaluationObject Pose Estimation

  11. Visual Grounding Safety in Vision-Language Models

    Oct 5, 2026Erfan Shayegani, Kundan Krishna, Yue Dong +3VLM EvaluationVision-Language Grounding

  12. RMMBench: A Comprehensive Benchmark for Robotic Mobile Manipulation

    Oct 4, 2026Huapeng Li, Fuxiang Feng, Jinqiu Fan +5VLM EvaluationLong-Horizon Robotic Manipulation

  13. A Strong Baseline for Evaluating Vision Encoders in Multimodal Large Language Models

    Oct 4, 2026Yilin Yang, Jun-Tao Tang, Kengyi Wang +3VLM EvaluationMultimodal Large Language Models

  14. Hob-VL: A Benchmark for Visually Grounded Boolean Reasoning

    Oct 1, 2026Yuzhou Wang, Emile Anand, Ijay NarangVLM EvaluationVisual Question Answering

  15. VIEScore2: Unified Image Evaluation with Spatially Grounded Explanations

    Oct 1, 2026Xianda Du, Max Ku, Weiming Ren +5VLM EvaluationImage Editing Evaluation

  16. Two Clocks in Diffusion MLLMs: When Answers Stabilize Before Rationales Unfold

    Oct 1, 2026Keuntae Kim, Yong Suk ChoiVLM EvaluationVisual Question Answering

  17. A Matched-Budget Audit Framework for Recaptioned Image-Text Supervision Distributions

    Oct 1, 2026Giyeong Oh, Junghun Park, Yuhan Bae +1VLM EvaluationT2I Generation

  18. Are Frontier VLM Agents Ready to Be Robot Generalists? An Empirical Study with the Embodied Agent Arena

    Oct 1, 2026Haojian Huang, Pukun Zhao, Zexi Li +7VLM EvaluationVisual Reasoning

  19. VisionQ: VLM-as-a-Judge Taxonomy, Dataset and Benchmark for Qualitative Analysis in Computer Vision

    Sep 30, 2026Vu Dinh Xuan, Duc-Hai Nguyen, Minh-Dung Dao +6VLM EvaluationVision-Language Model-as-a-Judge

  20. PhysVista: Benchmarking Physical Intelligence in VLMs via a Perception-Reasoning-Assessment Loop

    Sep 30, 2026Xinge Peng, Yiting Lu, Tianwu Zhi +4VLM EvaluationPhysical Consistency in Video Generation

  21. Frozen Scenes, Shifting Winners: Configuration Fragility in Text-to-3D Evaluation

    Sep 30, 2026Anson Y. Lam, Shuqing Li, Michael R. LyuVLM EvaluationBenchmark Validity

  22. STARS: From Spatiotemporal Dynamics to Social Representations in Human-Robot Interaction

    Sep 30, 2026Nathan Tsoi, Michael J. Munje, Tejas Oberoi +5VLM EvaluationSocial Robot Navigation

  23. Typographic Attack Against VLM-based AI-generated Image Detection

    Sep 30, 2026Eunmin Lee, Jungwoo Kim, Jong-Seok LeeVLM EvaluationVLM Robustness

  24. Front-to-Back: Benchmarking Vision-Language Models for Asymmetric Cross-View Vehicle Re-Identification

    Sep 30, 2026Moseli Mots'oehli, Thulani BabeliVLM EvaluationImage Matching

  25. Caption-Mediated Perceived-Safety Estimation for Pedestrian Routing

    Sep 29, 2026Simon Parkinson, Paloma Liu, Wei Zheng +1VLM EvaluationExplainable Artificial Intelligence