VLM Evaluation

VLM: Vision-Language Model

Latest papers 649

All topics
CardsList
  1. Empirical Bayes Conformal Prediction for Vision and Language Models

    May 22, 2026Jiapeng Zeng, Yogesh Prabhu, Zhanpeng Zeng +2VLM EvaluationEmpirical Bayes

  2. DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving

    May 22, 2026Hao Vo, Khoa Vo, Phu Loc Nguyen +10VLM EvaluationAutonomous Driving Datasets

  3. VisAnalog: A Diagnostic Suite for Visual Concept Transfer on Natural Images

    May 22, 2026Zhaonan Li, Kyle R. Chickering, Bangzheng Li +13VLM EvaluationAnalogical Reasoning

  4. VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding

    May 21, 2026Haichen He, Jiayi Zhou, Sifeng Shang +3VLM EvaluationVideo Understanding

  5. Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?

    May 21, 2026Zixuan Lan, Luzhe Sun, Matthew R. Walter +1VLM EvaluationVLM Interpretability

  6. VGenST-Bench: A Benchmark for Spatio-Temporal Reasoning via Active Video Synthesis

    May 21, 2026Jinho Park, Youbin Kim, Hogun Park +1VLM EvaluationSpatiotemporal Reasoning

  7. JMed48k: A Multi-Profession Japanese Medical Licensing Benchmark for Vision-Language Model Evaluation

    May 21, 2026Yue Xun, Junyu Liu, Qian Niu +10VLM EvaluationHealthcare

  8. SDGBiasBench: Benchmarking and Mitigating Vision--Language Models' Biases in Sustainable Development Goals

    May 21, 2026Zihang Lin, Huaiyuan Qin, Muli Yang +1VLM EvaluationVision-Language Models

  9. BEiTScore: Reference-free Image Captioning Evaluation with an Efficient Cross-Encoder Model

    May 20, 2026Gonçalo Gomes, Bruno Martins, Chrysoula ZervaVLM EvaluationImage Captioning

  10. Ablate-to-Validate: Are Vision-Language Models Really Using Continuous Thought Tokens?

    May 20, 2026Tianyi Zhang, Mahtab Bigverdi, Ranjay KrishnaVLM EvaluationVLM Interpretability

  11. Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly

    May 20, 2026Aditya Chetan, Eric Cai, Peeyush Kushwaha +5VLM EvaluationTemporal Video Grounding

  12. TempGlitch: Evaluating Vision-Language Models for Temporal Glitch Detection in Gameplay Videos

    May 20, 2026Yakun Yu, Ashley Wiens, Adrián Barahona-Ríos +4VLM EvaluationAutomated Software Testing

  13. ArchSIBench: Benchmarking the Architectural Spatial Intelligence of Vision-Language Models

    May 20, 2026Qirui Shen, Wenda Wang, Jiachen Lu +5VLM EvaluationSpatial Reasoning Benchmarks

  14. VLA-REPLICA: A Low-Cost, Reproducible Benchmark for Real-World Evaluation of Vision-Language-Action Models

    May 20, 2026Alex S. Huang, Jiahui Zhang, Shiqing Tang +1VLM EvaluationVision-Language-Action Models

  15. TASTE: A Designer-Annotated Multi-Dimensional Preference Dataset for AI-Generated Graphic Design

    May 20, 2026Haonan Zhu, Elad Hirsch, Alexandria Minetti +3VLM EvaluationT2I Generation Evaluation

  16. VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence

    May 20, 2026Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu +5VLM EvaluationVisual Question Answering

  17. Beyond Text and Tables: Vision-Language Model Integration in ComProScanner for Extracting Materials Data from Scientific Figures with High Accuracy

    May 19, 2026Aritra Roy, Enrico Grisan, Chiara Gattinoni +1VLM EvaluationDocument Information Extraction

  18. CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models

    May 19, 2026Hsiang-Wei Huang, Junbin Lu, Kuang-Ming Chen +3VLM Evaluation3D Spatial Reasoning

  19. Beyond Binary Success: A Diagnostic Meta-Evaluation Framework for Fine-Grained Manipulation

    May 19, 2026He-Yang Xu, Pengyuan Zhang, Zongyuan Ge +5VLM EvaluationRobotic Manipulation

  20. WildRoadBench: A Wild Aerial Road-Damage Grounding Benchmark for Vision-Language Models and Autonomous Agents

    May 19, 2026Bingnan Liu, Chenhang Cui, Rui Huang +7VLM EvaluationAI Agent Benchmarks

  21. Eyes on VLM: Benchmarking Gaze Following and Social Gaze Prediction in Vision Language Models

    May 19, 2026Hengfei Wang, Anshul Gupta, Pierre Vuillecard +1VLM EvaluationGaze Estimation

  22. FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding

    May 19, 2026Gueter Josmy Faure, Min-Hung Chen, Jia-Fong Yeh +2VLM EvaluationTemporal Video Grounding

  23. ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison

    May 19, 2026Tianle Li, Xuyang Shen, Yan Ma +7VLM EvaluationReward Modeling

  24. EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data

    May 18, 2026Dongyan Lin, Phillip Rust, Angel Villar Corrales +19VLM EvaluationVision-Language Models

  25. Automated Grading of Handwritten Mathematics Using Vision-Capable LLMs

    May 18, 2026Jacob Levine, Miguel Aenlle, Craig Zilles +2VLM EvaluationRubric-Based Evaluation

  26. How Good LLMs Are at Answering Bangla Medical Visual Questions? Dataset and Benchmarking

    May 18, 2026Rafid Ahmed, Intesar Tahmid, Mir Sazzat Hossain +3VLM EvaluationMultilingual Language Model Evaluation