Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models

    Mar 19, 2026Thomas De Min, Subhankar Roy, Stéphane Lathuilière +2Multimodal Large Language ModelsAI Agent Benchmarks

  2. SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models

    Mar 17, 2026Tianyu Xie, Jinfa Huang, Yuexiao Ma +11Audio-Visual UnderstandingSpoken Dialogue Systems

  3. NeSy-Route: A Neuro-Symbolic Benchmark for Constrained Route Planning in Remote Sensing

    Mar 17, 2026Ming Yang, Zhi Zhou, Shi-Yu Tian +3Remote Sensing Image UnderstandingRemote Sensing

  4. DamageArbiter: A Multimodal Arbitration Framework for Disaster Damage Assessment from Street-View Imagery

    Mar 16, 2026Yifan Yang, Lei Zou, Wenjing Gong +6Disaster Damage AssessmentMultimodal Classification

  5. GRADE: Benchmarking Discipline-Informed Reasoning in Image Editing

    Mar 12, 2026Mingxin Liu, Ziqian Fan, Zhaokai Wang +13Image Editing EvaluationText-Guided Image Editing

  6. CoMMET: A Psychologically Grounded Benchmark for Evaluating Theory of Mind in Multimodal LLMs

    Mar 12, 2026Ruirui Chen, Weifeng Jiang, Chengwei Qin +3Moral Reasoning in Language ModelsTheory of Mind

  7. EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning

    Mar 10, 2026Chengjun Yu, Xuhan Zhu, Chaoqun Du +4Multimodal Large Language ModelsEgocentric Video Understanding

  8. Designing UNICORN: a Unified Benchmark for Imaging in Computational Pathology, Radiology, and Natural Language

    Mar 3, 2026Michelle Stegeman, Lena Philipp, Fennie van der Graaf +20Computational PathologyMedical Imaging Foundation Models

  9. Beyond Pixels: A Vector-to-Graph Framework for Reliable Schematic Auditing

    Feb 12, 2026Chengwei Ma, Zhen Tian, Zhou Zhou +5Multimodal Large Language ModelsMultimodal Model Evaluation

  10. Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models

    Feb 11, 2026Sethuraman T, Savya Khosla, Aditi Tiwari +12VLM RobustnessVideo-Language Model Evaluation

  11. ARK: A Dual-Axis Multimodal Retrieval Benchmark along Reasoning and Knowledge

    Feb 10, 2026Yijie Lin, Guofeng Ding, Haochen Zhou +3Multimodal IRVisual Spatial Reasoning

  12. UReason: Benchmarking Reasoning-to-Generation Alignment in Unified Multimodal Models

    Feb 9, 2026Cheng Yang, Chufan Shi, Bo Shui +7Unified Multimodal ModelsImage Generation

  13. MMEarth-Bench: Global Model Adaptation via Multimodal Test-Time Training

    Feb 6, 2026Lucia Gordon, Serge Belongie, Christian Igel +1Test-Time AdaptationMultimodal Robustness

  14. RA-QA: A Benchmarking System for Respiratory Audio Question Answering Under Real-World Heterogeneity

    Feb 4, 2026Gaia A. Bertolino, Yuwei Zhang, Tong Xia +2Audio-Language Model EvaluationAudio QA

  15. Quantifying the Gap between Understanding and Generation within Unified Multimodal Models

    Feb 2, 2026Chenlong Wang, Yuhang Chen, Zhihan Hu +4Unified Multimodal ModelsCross-Modal Alignment

  16. SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding

    Jan 29, 2026Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum +2Audio-Language Model EvaluationMultimodal Grounding

  17. AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking

    Jan 25, 2026Xilin Jiang, Qiaolin Wang, Junkai Wu +30Audio-Visual UnderstandingMultimodal Large Language Models

  18. Social Caption: Evaluating Social Understanding in Multimodal Models

    Jan 21, 2026Leena Mathur, Bhaavanaa Thumu, Youssouf Kebe +1Multimodal Large Language ModelsMultimodal Reasoning

  19. AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs

    Jan 20, 2026Aahana Basappa, Pranay Goel, Anusri Karra +3Reasoning EvaluationMultimodal Large Language Models

  20. M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding

    Jan 13, 2026Juntao Jiang, Jiangning Zhang, Yali Bi +7Medical VLMsMultimodal CoT Reasoning

  21. BabyVision: Visual Reasoning Beyond Language

    Jan 10, 2026Liang Chen, Weichu Xie, Yiyan Liang +27VLM EvaluationVisual Reasoning

  22. Towards Multi-modal Multi-turn Safety: From Agentic Interaction to Strategic Alignment

    Jan 8, 2026Han Zhu, Jiale Chen, Chengkun Cai +8Language Model Safety EvaluationMultimodal Large Language Models

  23. Unexplored flaws in multiple-choice VQA make benchmarking unreliable

    Nov 27, 2025Fabio Rosenthal, Sebastian Schmidt, Thorsten Graf +3Visual Question AnsweringPrompt Sensitivity

  24. Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain

    Oct 20, 2025Yulin Luo, Chun-Kai Fan, Menghang Dong +19Long-Horizon Robotic ManipulationMultimodal Large Language Models

  25. From Charts to Code: A Hierarchical Benchmark for Multimodal Models

    Oct 20, 2025Jiahao Tang, Henry Hengyuan Zhao, Lijian Wu +8Data VisualizationCode Generation

  26. LM Fight Arena: Benchmarking Large Multimodal Models via Game Competition

    Oct 10, 2025Yushuo Zheng, Tongrui Ye, Zicheng Zhang +3Multimodal Large Language ModelsAI Agent Benchmarks

  27. NeMo: Needle in a Montage for Video-Language Understanding

    Sep 29, 2025Zi-Yuan Hu, Shuo Liang, Duo Zheng +10Temporal Video GroundingVideo-Language Model Evaluation

  28. The Platonic Universe: Do Foundation Models See the Same Sky?

    Sep 23, 2025UniverseTBD, :, Trinidad Borrell +11Cross-Modal AlignmentMultimodal Model Evaluation