VLM Evaluation

VLM: Vision-Language Model

Latest papers 649

All topics
CardsList
  1. Composition, Not Conversation: VLMs Lose the Scene, Not the Thread

    Sep 29, 2026L. D. M. S. Sai Teja, Ufaq Khan, N. Siva Gopala Krishna +5VLM EvaluationVisual Question Answering

  2. It's Not What the Image Shows: Irrelevant Context Destabilises VLM Judges Without Informing Them

    Sep 29, 2026Nagham Omar, Mahmoud Jabarin, Kinan Ibraheem +1VLM EvaluationFigurative Language Understanding

  3. Hierarchical Compression of Vision-Language Model Benchmarks

    Sep 29, 2026Hyunjong Ok, Seunggu Kang, Jaeho LeeVLM Evaluation

  4. Benchmarking Vision-Language Models on Synapse Detection and Proofreading in Connectomics

    Sep 29, 2026Yicong Li, Junjie Wang, Leander Lauenburg +5VLM EvaluationVLM Adaptation

  5. ScAn-Bench: Evaluating Scaling Analysis Methodology

    Sep 28, 2026Artin Sermaxhaj, Nastaran Alipour, Donat Sinani +4VLM EvaluationLLM Evaluation

  6. When Words Speak Louder than Images: Towards Understanding Language Bias in Vision-Language Models

    Sep 28, 2026Yizhou Fang, Siyue Chen, Zimo Qi +3VLM EvaluationVision-Language Models

  7. THEIA: A Multimodal Dataset and Benchmark for Vision-Language Analysis of Layout

    Sep 28, 2026Giuseppe Chiari, Michele Piccoli, Federico Viola +1VLM EvaluationElectronic Design Automation

  8. ControlTrace: Recovering Control Fields for Hidden-Content Recognition

    Sep 28, 2026Zijian Liu, Yaoguang Chen, Liwei Liu +4VLM EvaluationVision-Language Models

  9. When VLMs Trust Context: Evaluating Scene Text Recognition under Misleading Context

    Sep 28, 2026Yuxing Cheng, Yuan Wu, Yi ChangVLM EvaluationCounterfactual Evaluation of VLMs

  10. Before the Token Commits: Trajectory-Level Benchmarking of Visual Hallucinations in Diffusion VLMs

    Sep 28, 2026Yadong Wang, Siping Yue, Yu Tian +2VLM EvaluationVision-Language Models

  11. Seeing and Solving Are Not Enough for Vision-Language Models

    Sep 27, 2026Ziheng Wang, Mingxuan Xie, Yilin Liu +3VLM EvaluationVisual Question Answering

  12. A Visual Classification Dataset and Model Evaluation for Historical Manuscript Illustrations

    Sep 27, 2026Yoav Evron, Michal Bar-Asher Siegal, Michael FireVLM EvaluationHistorical Document Analysis

  13. MoGround: Measuring and Mitigating Modality Distraction in Vision-Language Models

    Sep 27, 2026Luca Zhou, Bo Zhao, Rose Yu +2VLM EvaluationMultimodal Grounding

  14. GHOST-Q: Towards Studying Grounding Hallucinations Overlooked Under Same-score TradeOffs in Quantized VLMS

    Sep 24, 2026Saim Rehman, Muhammad ShafiqueVLM EvaluationVLM Quantization

  15. Gender Bias in Vision-Language In-Context Learning

    Sep 23, 2026Tong Xiang, Yuta Nakashima, Noa GarciaVLM EvaluationIn-Context Learning

  16. Beyond Balanced Accuracy: A Resolution and Parity-Controlled Benchmark for Vision-Language and Vision-Only Defect Assessment in UAV Power-Line Inspection

    Sep 23, 2026Linghao Zhang, Siyu Xiang, Junwei Kuang +1VLM EvaluationAnomaly Detection

  17. Do LiDAR Language Models Really Understand Spatio-temporal Relationships?

    Sep 21, 2026Runyi Yang, Murat Akkoyun, Di Wen +8VLM EvaluationHallucination Detection in VLMs

  18. ChartJudgeBench: Evaluating LMM Judges for Chart-to-Code Generation

    Sep 21, 2026Lijian Wu, Henry Hengyuan Zhao, Zijian Zhang +3VLM EvaluationLLM Evaluation

  19. LegendBench: A Diagnostic Benchmark for Legend Understanding with Counterfactual Interventions

    Sep 21, 2026Xinnuo Zhang, Zhike Tang, Jing Xu +2VLM EvaluationCounterfactual Evaluation of VLMs

  20. Benchmarking MLLMs via Cognitive Expected Scene Graph for Safety-Critical Visual Negation Understanding

    Sep 17, 2026Zhiyun Jiang, Hanyong Wang, Binbin Liang +3VLM Evaluation

  21. Can Vision-Language Models Judge Olympic Diving? From Reasoning to Scores in Zero-Shot Action Quality Assessment

    Sep 16, 2026Henry O. Velesaca, David Freire-Obregon, Luigi Miranda +1VLM EvaluationAction Quality Assessment