VLM Evaluation

VLM: Vision-Language Model

Latest papers 649

All topics
CardsList
  1. A General-Purpose VLM Can Teach an Astronomy Foundation Model to Better Recognize Galaxy Morphology

    Aug 3, 2026Dichang Zhang, Jiaqi Deng, Yixuan Shao +7VLM EvaluationAI-Assisted Scientific Research

  2. Can Urban Blight Be Accessed with Vision-language Models: A Case Study in Detroit

    Aug 3, 2026Xiaohao Yang, Aohua Tian, Derek Van Berkel +2VLM EvaluationVision-Language Models

  3. Evaluating VLMs on Multimodal Aristotelian Persuasion Tasks

    Aug 2, 2026Khondoker Ittehadul IslamVLM EvaluationVision-Language Models

  4. It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling

    Aug 2, 2026Puzhuo Zheng, Hasan KurbanVLM EvaluationSelf-Consistency Decoding

  5. Cross-Task Dissociation in Frontier Vision-Language Model Theory of Mind

    Jul 31, 2026Kejia Zhang, Youran Sun, Chugang Yi +1VLM EvaluationTheory of Mind

  6. Sycophancy Undermines Epistemic Vigilance in Cooperative Vision-Language Tasks

    Jul 31, 2026Rupak Sarkar, Neha Srikanth, Saloni Gupta +3VLM EvaluationVision-Language Models

  7. Is It Time for the Renaissance of Salient Object Detection in the Era of MLLMs?

    Jul 31, 2026Wenzhuo Zhao, Xiuzhi Li, Zhongkuan Mao +6VLM EvaluationSalient Object Detection

  8. SciFigPlag-Bench: A Benchmark for Provenance-Aware Scientific Figure Plagiarism Detection

    Jul 31, 2026Zhiying Cui, Minghao Yang, Linlin Gao +2VLM EvaluationImage Forgery Detection

  9. OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

    Jul 30, 2026Qiushi Sun, Kanzhi Cheng, Yian Wang +20VLM EvaluationComputer-Use Agent Benchmarks

  10. Scaling Vision-Language Models Is Not Enough to Mitigate Bias

    Jul 30, 2026Ioannis Sarridis, Ioannis Kompatsiaris, Symeon PapadopoulosVLM EvaluationVLM Robustness

  11. MemeBench: What LVLMs Miss When Interpreting Culture-Dependent Memes

    Jul 30, 2026Weihang Wang, Kainan Tu, Jielei Zhang +9VLM EvaluationVision-Language Models

  12. Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities

    Jul 30, 2026Liangjie Zhao, Jiaqing Lyu, Kexin Tang +5VLM EvaluationVisual Reasoning

  13. JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles

    Jul 30, 2026Shawn Li, Wei Yang, Jike Zhong +11VLM EvaluationSpatial Reasoning Benchmarks

  14. Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers

    Jul 30, 2026Fexiang Liu, Shiye Wang, Qiang Qiu +1VLM EvaluationMultimodal Large Language Models

  15. HumanCLAW: Can Vision-Language Models Act Through a Body?

    Jul 29, 2026Li Siyao, Jiawei Gu, Shuai Liu +15VLM EvaluationEmbodied AI

  16. Visual Credit Audit for Multimodal Spatial Reasoning

    Jul 29, 2026Feixiang Liu, Qiang Qiu, Lanbo Sun +3VLM EvaluationSpatial Reasoning Benchmarks

  17. Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference

    Jul 29, 2026Feixiang Liu, Qiang Qiu, Hao Zhang +1VLM EvaluationEfficient VLM Inference

  18. Hearsay: Vision-Language Medical Diagnoses Without an Image

    Jul 29, 2026Siddharth VohraVLM EvaluationMedical Image Analysis

  19. Level, Sharpness, and Corpus: Why Zero-Shot OOD Detector Rankings Do Not Transfer

    Jul 29, 2026Ignacio M. De la Jara, Cristian Rodriguez-Opazo, Stephen Gould +1VLM EvaluationDistribution Shift Detection

  20. An evolutionary model of animats with VLM-based subjective evaluation

    Jul 29, 2026Shota Miyazaki, Takaya Arita, Reiji SuzukiVLM EvaluationRobotics

  21. Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

    Jul 28, 2026Jiaang Li, Chengzu Li, Zhaochong An +4VLM EvaluationMultimodal Large Language Models

  22. Evaluating VLMs for Autonomous Agent-Driven Geometry Clipping Detection in Video Game QA

    Jul 28, 2026Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos +2VLM EvaluationVLM Robustness

  23. ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams

    Jul 27, 2026Ali Ansari, Yasmin Mohammadi, Farnoush Nili +3VLM EvaluationDocument Image Understanding

  24. When Low CER is Not Enough: An Analysis of Hallucinations in Vision-Language OCR Systems on Historical Uruguayan Documents

    Jul 27, 2026Marina Gardella, Camilo Mariño, Diego Belzarena +3VLM EvaluationVLM Hallucination

  25. Cheap Probes Predict Expensive Training in 3D-CT Vision--Language Models

    Jul 24, 2026Renjie LiangVLM EvaluationMedical VLMs

  26. Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints

    Jul 23, 2026Liqiang Jing, Xiong Zhou, Siddharth Varia +3VLM EvaluationVisual Reasoning