VLM Evaluation

VLM: Vision-Language Model

Latest papers 649

All topics
CardsList
  1. BanglaWild: An In-the-Wild Bengali Scene Text Recognition Benchmark for OCR and Vision-Language Models

    Aug 4, 2026Sadab Shiper, Tawsif Tashwar Dipto, Mir Md Inzamam +1VLM EvaluationScene Text Recognition

  2. Does Forgetting Transfer Across Modalities? A Real-World Benchmark for Cross-Modal Knowledge Unlearning Evaluation

    Aug 4, 2026Chunlin Liu, Junnian Chen, Haitong Jiang +7VLM EvaluationVLM Unlearning

  3. COMEX: A Composition-Grounded Benchmark and Learning Framework for Explainable Aesthetic Image Cropping

    Aug 4, 2026Rui Yang, Wei Zhou, Dingyong Gou +5VLM EvaluationImage Editing

  4. Confident but Unreliable: A Behavioral Safety Audit of Vision-Language Models on Brain MRI

    Aug 3, 2026Amir Sabbaghziarani, Mohammadsajad Abavisani, Sergey PlisVLM EvaluationVLM Hallucination

  5. Advancing Relevance Measurement with Vision-Language Models for Web-Scale Search

    Aug 3, 2026Han Wang, Alex Whitworth, Pak Ming Cheung +5VLM EvaluationAutomated Evaluation

  6. A General-Purpose VLM Can Teach an Astronomy Foundation Model to Better Recognize Galaxy Morphology

    Aug 3, 2026Dichang Zhang, Jiaqi Deng, Yixuan Shao +7VLM EvaluationAI-Assisted Scientific Research

  7. Can Urban Blight Be Accessed with Vision-language Models: A Case Study in Detroit

    Aug 3, 2026Xiaohao Yang, Aohua Tian, Derek Van Berkel +2VLM EvaluationVision-Language Models

  8. Evaluating VLMs on Multimodal Aristotelian Persuasion Tasks

    Aug 2, 2026Khondoker Ittehadul IslamVLM EvaluationVision-Language Models

  9. It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling

    Aug 2, 2026Puzhuo Zheng, Hasan KurbanVLM EvaluationSelf-Consistency Decoding

  10. Cross-Task Dissociation in Frontier Vision-Language Model Theory of Mind

    Jul 31, 2026Kejia Zhang, Youran Sun, Chugang Yi +1VLM EvaluationTheory of Mind

  11. Sycophancy Undermines Epistemic Vigilance in Cooperative Vision-Language Tasks

    Jul 31, 2026Rupak Sarkar, Neha Srikanth, Saloni Gupta +3VLM EvaluationVision-Language Models

  12. Is It Time for the Renaissance of Salient Object Detection in the Era of MLLMs?

    Jul 31, 2026Wenzhuo Zhao, Xiuzhi Li, Zhongkuan Mao +6VLM EvaluationSalient Object Detection

  13. SciFigPlag-Bench: A Benchmark for Provenance-Aware Scientific Figure Plagiarism Detection

    Jul 31, 2026Zhiying Cui, Minghao Yang, Linlin Gao +2VLM EvaluationImage Forgery Detection

  14. OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

    Jul 30, 2026Qiushi Sun, Kanzhi Cheng, Yian Wang +20VLM EvaluationComputer-Use Agent Benchmarks

  15. Scaling Vision-Language Models Is Not Enough to Mitigate Bias

    Jul 30, 2026Ioannis Sarridis, Ioannis Kompatsiaris, Symeon PapadopoulosVLM EvaluationVLM Robustness

  16. MemeBench: What LVLMs Miss When Interpreting Culture-Dependent Memes

    Jul 30, 2026Weihang Wang, Kainan Tu, Jielei Zhang +9VLM EvaluationVision-Language Models

  17. Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities

    Jul 30, 2026Liangjie Zhao, Jiaqing Lyu, Kexin Tang +5VLM EvaluationVisual Reasoning

  18. JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles

    Jul 30, 2026Shawn Li, Wei Yang, Jike Zhong +11VLM EvaluationSpatial Reasoning Benchmarks

  19. Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers

    Jul 30, 2026Fexiang Liu, Shiye Wang, Qiang Qiu +1VLM EvaluationMultimodal Large Language Models

  20. HumanCLAW: Can Vision-Language Models Act Through a Body?

    Jul 29, 2026Li Siyao, Jiawei Gu, Shuai Liu +15VLM EvaluationEmbodied AI

  21. Visual Credit Audit for Multimodal Spatial Reasoning

    Jul 29, 2026Feixiang Liu, Qiang Qiu, Lanbo Sun +3VLM EvaluationSpatial Reasoning Benchmarks

  22. Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference

    Jul 29, 2026Feixiang Liu, Qiang Qiu, Hao Zhang +1VLM EvaluationEfficient VLM Inference

  23. Hearsay: Vision-Language Medical Diagnoses Without an Image

    Jul 29, 2026Siddharth VohraVLM EvaluationMedical Image Analysis

  24. Level, Sharpness, and Corpus: Why Zero-Shot OOD Detector Rankings Do Not Transfer

    Jul 29, 2026Ignacio M. De la Jara, Cristian Rodriguez-Opazo, Stephen Gould +1VLM EvaluationDistribution Shift Detection

  25. An evolutionary model of animats with VLM-based subjective evaluation

    Jul 29, 2026Shota Miyazaki, Takaya Arita, Reiji SuzukiVLM EvaluationRobotics

  26. Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

    Jul 28, 2026Jiaang Li, Chengzu Li, Zhaochong An +4VLM EvaluationMultimodal Large Language Models