VLM Evaluation

VLM: Vision-Language Model

Latest papers 649

All topics
CardsList
  1. VLMs May Not Globally Enhance Human Alignment over LLMs During Natural Reading

    May 27, 2026Jinzhou Wu, Zhengwu Ma, Jixing Li +2VLM EvaluationVision-Language Models

  2. The Abstraction Gap in Vision-Language Causal Reasoning

    May 27, 2026Chinh Hoang, Mohammad Rashedul HasanVLM EvaluationCausal Reasoning in Language Models

  3. When Discourse Pressures Conflict: Information Structure in Vision-Language Model Outputs

    May 27, 2026Marcell Fekete, Johannes Bjerva, Tamás KáldiVLM EvaluationVisual Question Answering

  4. PointQ-Bench: Benchmarking Diagnostic and Interpretable Point Cloud Quality Assessment

    May 27, 2026Duanchu Wang, Cheng Li, Junjie Yang +5VLM EvaluationPoint Cloud Understanding

  5. Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

    May 27, 2026Carmen Quiles-Ramírez, Leticia L. Rodríguez, Nicolás Martorell +1VLM EvaluationMultimodal Large Language Models

  6. Evolving to the Aesthetics of a Vision-Language Model

    May 27, 2026Stephen James Krol, Jon McCormackVLM EvaluationPreference Learning

  7. Real Images, Worse Judgments: Evaluating Vision-Language Models on Concreteness and Imagery

    May 26, 2026Yifan Jiang, Ruoxi Ning, Sheng Yao +1VLM EvaluationVision-Language Models

  8. Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models

    May 26, 2026Yifan Jiang, Dae Yon Hwang, Jesse C. Cresswell +1VLM EvaluationData Visualization

  9. EpiCurveBench: Evaluating VLMs on Epidemic Curve Digitization

    May 26, 2026Thomas Berkane, Maimuna S. MajumderVLM EvaluationChart Data Extraction

  10. On the Robustness of Machine Unlearning for Vision-Language Models

    May 26, 2026Yujie Lin, Kaidi Jia, Jiayao Ma +2VLM EvaluationVLM Unlearning

  11. METATR: A Multilingual, Evolving Benchmark for Automatic Text Recognition

    May 26, 2026Mélodie Boillet, Solène Tarride, Christopher KermorvantVLM EvaluationOnline Handwriting Recognition

  12. FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling

    May 26, 2026Guixian Xu, Yide Liang, Zeli Su +5VLM EvaluationVision-Language Models

  13. VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes

    May 25, 2026Jingru Chen, Yiming Liu, Mingtao Chen +5VLM EvaluationTool Use in VLMs

  14. LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

    May 25, 2026Xiang An, Yin Xie, Feilong Tang +27VLM EvaluationTemporal Video Grounding

  15. Beyond Appearance: Can Multimodal Large Language Models Exploit Vertical Structure for Remote Sensing Natural Scene Understanding?

    May 25, 2026Jing Huang, Duanchu Wang, Junjie Yang +5VLM EvaluationRemote Sensing Image Understanding

  16. Towards Open-World Referring Expression Comprehension: A Benchmark with Training-free Multi-task Consistency Checker

    May 25, 2026Zongjian Wu, Lei ZhangVLM EvaluationVision-Language Grounding

  17. MetaphorVU: Towards Metaphorical Video Understanding

    May 25, 2026Zhuoqun Li, Boxi Cao, Guiping Jiang +13VLM EvaluationFigurative Language Understanding

  18. Do Image-Text Metrics Respect Semantic Invariances?

    May 23, 2026Amit Agarwal, Hitesh Laxmichand Patel, Meizhu Liu +9VLM EvaluationMultimodal Robustness

  19. FoodMonitor: Benchmarking MLLMs for Explainable Compliance Analysis

    May 23, 2026Ruihao Xu, Xingming Shui, Jingxuan Niu +4VLM EvaluationVideo Anomaly Detection

  20. SPACENUM: Revisiting Spatial Numerical Understanding in VLMs

    May 22, 2026Jianshu Zhang, Yijiang Li, Huifeixin Chen +4VLM EvaluationVisual Spatial Reasoning

  21. General Hazard Detection

    May 22, 2026Stephanie Ng, CP Lim, SueJen Looi +5VLM EvaluationAI Safety Evaluation

  22. EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

    May 22, 2026Songlin Yang, Haobin Zhong, Ruilin Zhang +23VLM EvaluationVideo Quality Assessment

  23. CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering

    May 22, 2026Mingfang Zhang, Jingjing Pan, Ashutosh Kumar +7VLM EvaluationTemporal Video Grounding