VLM Evaluation

VLM: Vision-Language Model

Latest papers 649

All topics
CardsList
  1. DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

    May 10, 2026Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi +7VLM EvaluationTool Use in VLMs

  2. SoccerLens: Grounded Soccer Video Understanding Beyond Accuracy

    May 10, 2026Ismael Elsharkawi, Ahmed Sait, Silvio Giancola +3VLM EvaluationSports Video Analysis

  3. From Pixels to Concepts: Do Segmentation Models Understand What They Segment?

    May 10, 2026Shuang Liang, Zeqing Wang, Yuxian Li +2VLM EvaluationImage Segmentation

  4. Language-Conditioned Visual Grounding with CLIP Multilingual

    May 9, 2026J. de Curtò, Mauro Liz, I. de ZarzàVLM EvaluationMultilingual VLM Evaluation

  5. Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models

    May 9, 2026Tri Cao, Khoi Le, Thong Nguyen +7VLM EvaluationObject Hallucination in VLMs

  6. PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models

    May 9, 2026Jiahui Guang, Zexun Zhan, Zhenlin Xu +5VLM EvaluationVLM Unlearning

  7. Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models

    May 9, 2026Mashrafi Monon, Umaima Rahman, Asif Hanif +2VLM Evaluation3D Spatial Reasoning

  8. NICE FACT: Diagnosing and Calibrating VLMs in Quantitative Reasoning for Kinematic Physics

    May 8, 2026Jian Lan, Zhicheng Liu, Xinpeng Wang +5VLM EvaluationPhysical Reasoning

  9. MedVIGIL: Evaluating Trustworthy Medical VLMs Under Broken Visual Evidence

    May 8, 2026Hanqi Jiang, Junhao Chen, Mingyu Kang +12VLM EvaluationVLM Robustness

  10. RuleSafe-VL: Evaluating Rule-Conditioned Decision Reasoning in Vision-Language Content Moderation

    May 8, 2026Zhifeng Lu, Dianyuan Wang, Yuhu Shang +1VLM EvaluationLogical Reasoning

  11. Towards Annotation-Free Validation of MLLMs: A Vision-Language Logical Consistency Metric

    May 7, 2026Ying Gu, Mei Chee Leong, Hui Li Tan +3VLM EvaluationLarge Vision-Language Models

  12. CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs

    May 7, 2026Zhengru Fang, Yanan Ma, Yu Guo +5VLM EvaluationChest X-Ray Classification

  13. iTRIALSPACE: Programmable Virtual Lesion Trials for Controlled Evaluation of Lung CT Models

    May 7, 2026Fakrul Islam Tushar, Umme Hafsa Momy, Joseph Y. Lo +1VLM EvaluationRadiology VLMs

  14. How Far Are VLMs from Privacy Awareness in the Physical World? An Empirical Study

    May 6, 2026Junran Wang, Xinjie Shen, Zehao Jin +1VLM EvaluationVision-Language Models

  15. StableI2I: Spotting Unintended Changes in Image-to-Image Transition

    May 6, 2026Jiayang Li, Shuo Cao, Xiaohui Li +6VLM EvaluationImage Editing Evaluation

  16. Before Forgetting, Learn to Remember: Revisiting Foundational Learning Failures in LVLM Unlearning Benchmarks

    May 5, 2026JuneHyoung Kwon, MiHyeon Kim, Eunju Lee +3VLM EvaluationVLM Unlearning

  17. Erase Persona, Forget Lore: Benchmarking Multimodal Copyright Unlearning in Large Vision Language Models

    May 5, 2026JuneHyoung Kwon, JungMin Yun, YoungBin KimVLM EvaluationVLM Unlearning

  18. MHPR: Multidimensional Human Perception and Reasoning Benchmark for Large Vision-Languate Models

    May 5, 2026Kangkang Wang, Qinting Jiang, Wanping Zhang +2VLM EvaluationVision-Language Models

  19. VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition

    May 4, 2026Tanush Yadav, Mohammadreza Salehi, Jae Sung Park +6VLM EvaluationVLM Adaptation

  20. Does it Really Count? Assessing Semantic Grounding in Text-Guided Class-Agnostic Counting

    May 4, 2026Giacomo Pacini, Luca Ciampi, Nicola Messina +3VLM EvaluationVLM Robustness

  21. SurgCheck: Do Vision-Language Models Really Look at Images in Surgical VQA?

    May 3, 2026Jongmin Shin, Ka Young Kim, Eunki Cho +2VLM EvaluationMedical VQA

  22. SF20K Competition 2025: Summary and findings

    May 2, 2026Ridouane Ghermi, Xi Wang, Vicky Kalogeiton +1VLM EvaluationVideo Understanding

  23. VISTA: Video Interaction Spatio-Temporal Analysis Benchmark

    May 2, 2026Alejandro Aparcedo, Akash Kumar, Aaryan Garg +5VLM EvaluationVideo Understanding

  24. Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification

    May 1, 2026Charles Weng, Dingwen Li, Alexander MartinVLM EvaluationZero-Shot Learning

  25. Stable Behavior, Limited Variation: Persona Validity in LLM Agents for Urban Sentiment Perception

    Apr 30, 2026Neemias B da Silva, Rodrigo Minetto, Daniel Silver +1VLM EvaluationPersonality Modeling in Language Models

  26. ClimateVID -- Social Media Videos Analysis and Challenges Involved

    Apr 30, 2026Shiqi Xu, Moritz Burmester, Katharina Prasse +3VLM EvaluationSocial Media Analysis