VLM Evaluation

VLM: Vision-Language Model

Latest papers 649

All topics
CardsList
  1. SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models

    May 11, 2026Chen Zhong, Xiao An, Jiaxing Sun +3VLM EvaluationRemote Sensing

  2. Sens-VisualNews: A Benchmark Dataset for Sensational Image Detection

    May 11, 2026Andreas Goulas, Damianos Galanopoulos, Evlampios Apostolidis +1VLM EvaluationVLM Robustness

  3. SleepWalk: A Three-Tier Benchmark for Stress-Testing Instruction-Guided Vision-Language Navigation

    May 11, 2026Niyati Rawal, Sushant Ravva, Shah Alam Abir +5VLM EvaluationSpatial Reasoning Benchmarks

  4. RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild

    May 11, 2026Danni Xu, Shaojing Fan, Harry Cheng +1VLM EvaluationMultimodal Grounding

  5. The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark

    May 11, 2026Hao Liu, Jicheng LiuVLM EvaluationVision-Language Grounding

  6. The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space

    May 11, 2026Xia Hu, Zhenrui Yue, Brian Potetz +4VLM EvaluationSpatial Reasoning Benchmarks

  7. SAGE: Scalable Agentic Grounded Evaluation for Crop Disease Diagnosis

    May 10, 2026Muhammad Arbab Arshad, Tirtho Roy, Yanben Shen +7VLM EvaluationAgricultural Image Analysis

  8. DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

    May 10, 2026Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi +7VLM EvaluationTool Use in VLMs

  9. SoccerLens: Grounded Soccer Video Understanding Beyond Accuracy

    May 10, 2026Ismael Elsharkawi, Ahmed Sait, Silvio Giancola +3VLM EvaluationSports Video Analysis

  10. From Pixels to Concepts: Do Segmentation Models Understand What They Segment?

    May 10, 2026Shuang Liang, Zeqing Wang, Yuxian Li +2VLM EvaluationImage Segmentation

  11. Language-Conditioned Visual Grounding with CLIP Multilingual

    May 9, 2026J. de Curtò, Mauro Liz, I. de ZarzàVLM EvaluationMultilingual VLM Evaluation

  12. Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models

    May 9, 2026Tri Cao, Khoi Le, Thong Nguyen +7VLM EvaluationObject Hallucination in VLMs

  13. PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models

    May 9, 2026Jiahui Guang, Zexun Zhan, Zhenlin Xu +5VLM EvaluationVLM Unlearning

  14. Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models

    May 9, 2026Mashrafi Monon, Umaima Rahman, Asif Hanif +2VLM Evaluation3D Spatial Reasoning

  15. NICE FACT: Diagnosing and Calibrating VLMs in Quantitative Reasoning for Kinematic Physics

    May 8, 2026Jian Lan, Zhicheng Liu, Xinpeng Wang +5VLM EvaluationPhysical Reasoning

  16. MedVIGIL: Evaluating Trustworthy Medical VLMs Under Broken Visual Evidence

    May 8, 2026Hanqi Jiang, Junhao Chen, Mingyu Kang +12VLM EvaluationVLM Robustness

  17. RuleSafe-VL: Evaluating Rule-Conditioned Decision Reasoning in Vision-Language Content Moderation

    May 8, 2026Zhifeng Lu, Dianyuan Wang, Yuhu Shang +1VLM EvaluationLogical Reasoning

  18. Towards Annotation-Free Validation of MLLMs: A Vision-Language Logical Consistency Metric

    May 7, 2026Ying Gu, Mei Chee Leong, Hui Li Tan +3VLM EvaluationLarge Vision-Language Models

  19. CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs

    May 7, 2026Zhengru Fang, Yanan Ma, Yu Guo +5VLM EvaluationChest X-Ray Classification

  20. iTRIALSPACE: Programmable Virtual Lesion Trials for Controlled Evaluation of Lung CT Models

    May 7, 2026Fakrul Islam Tushar, Umme Hafsa Momy, Joseph Y. Lo +1VLM EvaluationRadiology VLMs

  21. How Far Are VLMs from Privacy Awareness in the Physical World? An Empirical Study

    May 6, 2026Junran Wang, Xinjie Shen, Zehao Jin +1VLM EvaluationVision-Language Models

  22. StableI2I: Spotting Unintended Changes in Image-to-Image Transition

    May 6, 2026Jiayang Li, Shuo Cao, Xiaohui Li +6VLM EvaluationImage Editing Evaluation

  23. Before Forgetting, Learn to Remember: Revisiting Foundational Learning Failures in LVLM Unlearning Benchmarks

    May 5, 2026JuneHyoung Kwon, MiHyeon Kim, Eunju Lee +3VLM EvaluationVLM Unlearning

  24. Erase Persona, Forget Lore: Benchmarking Multimodal Copyright Unlearning in Large Vision Language Models

    May 5, 2026JuneHyoung Kwon, JungMin Yun, YoungBin KimVLM EvaluationVLM Unlearning

  25. MHPR: Multidimensional Human Perception and Reasoning Benchmark for Large Vision-Languate Models

    May 5, 2026Kangkang Wang, Qinting Jiang, Wanping Zhang +2VLM EvaluationVision-Language Models

  26. VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition

    May 4, 2026Tanush Yadav, Mohammadreza Salehi, Jae Sung Park +6VLM EvaluationVLM Adaptation

  27. Does it Really Count? Assessing Semantic Grounding in Text-Guided Class-Agnostic Counting

    May 4, 2026Giacomo Pacini, Luca Ciampi, Nicola Messina +3VLM EvaluationVLM Robustness