VLM Evaluation

VLM: Vision-Language Model

Latest papers 649

All topics
CardsList
  1. Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences

    Aug 11, 2026Martina Ianaro, Guilherme Fernandes, Maurizio Gabbrielli +1VLM EvaluationVision-Language Models

  2. VisEditBench: Can Vision-Language Models Edit Visualization Code from Multimodal Feedback?

    Aug 11, 2026Mizanur Rahman, Arshia Azimlu, Shadikur Rahman +4VLM EvaluationData Visualization

  3. More Accurate, Less Human: Gestalt Grouping in Vision Models

    Aug 10, 2026Sudhanva Manjunath Athreya, Sai Phani Kumar MalladiVLM EvaluationData Visualization

  4. Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

    Aug 10, 2026Diandian Zhang, Tingyu Song, Lin Fu +2VLM EvaluationVideo Generation

  5. PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models

    Aug 10, 2026Zhanna Mukhametsharip, Vera Demberg, Varsha SureshVLM EvaluationPragmatic Reasoning in Language Models

  6. Explore, Map, Remember, Decide: Are Embodied VLMs Ready for Safety-Critical Scenarios?

    Aug 8, 2026Gabriele La Malfa, Nitay Alon, Emanuele La Malfa +2VLM EvaluationMemory-Augmented VLMs

  7. How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems

    Aug 8, 2026Henri Vanhuynegem, Weitao Xu, Yiran Shen +1VLM EvaluationVisual Question Answering

  8. Jako Tako or Fluent? Presenting PoVisLE: A Polish Vision-Language Evaluation

    Aug 7, 2026Anna Kołos, Grzegorz Statkiewicz, Karolina Seweryn +3VLM EvaluationVisual Question Answering

  9. BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning

    Aug 7, 2026Saim Rehman, Muhammad ShafiqueVLM EvaluationVLM Robustness

  10. SABRE: Scalable and Automated Benchmarking of VLMs under Stress

    Aug 7, 2026Zixuan Lan, Luzhe Sun, Matthew R. Walter +1VLM EvaluationVLM Robustness

  11. Human-AI Perceptual Alignment by Playing Hues and Cues

    Aug 7, 2026Nuria Alabau-Bosque, Jorge Vila-Tomás, Paula Daudén-Oliver +3VLM EvaluationVision-Language Grounding

  12. Beyond Fluency: A Clinical Benchmark and Anomaly-Enhanced Baseline for Spine MRI Report Generation

    Aug 7, 2026Bruno Palau, Franziska Vogt, Daria Laslo +4VLM EvaluationRadiology Report Generation

  13. Generative Embedding Benchmark: How Much Information Survives in a Dense Embedding?

    Aug 7, 2026Yun Li, Biao Yang, Peixi Wu +5VLM EvaluationMultimodal Embedding

  14. GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models

    Aug 7, 2026Yuanfu Sun, Yuanhang Ren, Kang Li +5VLM EvaluationVisual Reasoning

  15. Visual Grounding in Zero-Shot Vision-Language Control

    Aug 6, 2026J. de Curtò, Dayani Plasencia, Diego Sánchez +1VLM EvaluationVLMs for Autonomous Driving

  16. VLMs for Videogame Data Annotation

    Aug 6, 2026Katrin Schmid, Iuri FrosioVLM Evaluation

  17. GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

    Aug 6, 2026Qifeng Zhang, Kaixiang Huang, Heng Dong +6VLM EvaluationSpatial Reasoning Benchmarks

  18. Consistency Has a Computable Blind Spot: A Commutation Theory of Label-Free Reliability for Vision-Language Figure Reading

    Aug 6, 2026Rasul Khanbayov, Hasan KurbanVLM EvaluationVision-Language Models

  19. When Does Consensus Mean Correctness? Measuring the Agreement-Accuracy Coupling with Semantics-Preserving Re-Rendering

    Aug 6, 2026Rasul Khanbayov, Hasan KurbanVLM Evaluation

  20. TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs

    Aug 6, 2026Yanqi Wu, Runhe Lai, Xinhua Lu +5VLM EvaluationHallucination Detection in VLMs

  21. DynaPix: Can Vision-Language Models Identify the Exact Future?

    Aug 6, 2026Thong Nguyen, Vinh-Hien Do, Quynh Vo +2VLM EvaluationVision-Language Models

  22. Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations

    Aug 5, 2026Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian +1VLM EvaluationVLM Robustness

  23. BanglaWild: An In-the-Wild Bengali Scene Text Recognition Benchmark for OCR and Vision-Language Models

    Aug 4, 2026Sadab Shiper, Tawsif Tashwar Dipto, Mir Md Inzamam +1VLM EvaluationScene Text Recognition

  24. Does Forgetting Transfer Across Modalities? A Real-World Benchmark for Cross-Modal Knowledge Unlearning Evaluation

    Aug 4, 2026Chunlin Liu, Junnian Chen, Haitong Jiang +7VLM EvaluationVLM Unlearning

  25. COMEX: A Composition-Grounded Benchmark and Learning Framework for Explainable Aesthetic Image Cropping

    Aug 4, 2026Rui Yang, Wei Zhou, Dingyong Gou +5VLM EvaluationImage Editing

  26. Confident but Unreliable: A Behavioral Safety Audit of Vision-Language Models on Brain MRI

    Aug 3, 2026Amir Sabbaghziarani, Mohammadsajad Abavisani, Sergey PlisVLM EvaluationVLM Hallucination

  27. Advancing Relevance Measurement with Vision-Language Models for Web-Scale Search

    Aug 3, 2026Han Wang, Alex Whitworth, Pak Ming Cheung +5VLM EvaluationAutomated Evaluation