Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings

    Jul 21, 2026Ziyi Wang, Yuhang Wu, Dongxu Piao +3Theory of MindMultimodal Large Language Models

  2. Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges

    Jul 21, 2026Tuo Liang, Zhe Hu, Disheng Liu +2Multimodal Large Language ModelsComputational Creativity

  3. Style over Substance: A Shortcut Audit of Emotion-Description Preference Evaluation

    Jul 20, 2026Jiabing Yang, Yixiang Chen, Yuan Xu +6Human Preference EvaluationPairwise Preference Evaluation

  4. Now We Know? A Systematic Comparison of TerraMind and THOR

    Jul 20, 2026Frederick Schindlegger, Kenzo Bounegta, Eva Gmelich Meijling +5Geospatial Foundation ModelsRemote Sensing

  5. Can Multimodal Large Language Models Understand OCT?

    Jul 18, 2026Baochen Fu, Wenzhi Deng, Baihao Jin +5Medical ImagingMedical Image Analysis

  6. Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs

    Jul 17, 2026Like Liu, Zhengzheng Xu, Haitao He +3Multimodal GroundingAerial Robotics

  7. SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification

    Jul 17, 2026Bibesh Pyakurel, M. G. Sarwar MurshedBiometric IdentificationMultimodal Large Language Models

  8. Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions

    Jul 16, 2026Yijiang Li, Huiqi Zou, Bingyang Wang +1VLM EvaluationVLM Hallucination

  9. AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

    Jul 14, 2026Yanghai Wang, Jiahao Wang, Jiafu Tang +9Audio-Visual UnderstandingAudio-Visual Alignment

  10. Beyond the Single Camera: Agentic Multi-View Reasoning in Sports Video Understanding

    Jul 13, 2026Kerui Chen, Jinglu Wang, Xiaoyi Zhang +1Active PerceptionSports Video Analysis

  11. Capabilities of Claude Fable 5 on Biomedical Challenge Problems

    Jul 12, 2026Dominic Okonkwo, Magnus Hodgson, Temitope I. David +1Biomedical QALLM Refusal Behavior

  12. MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation

    Jul 10, 2026Runhan Shi, Quan Zhou, Yuqian Xu +14HealthcareClinical Language Model Evaluation

  13. Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

    Jul 9, 2026Matteo Santelmo, Xiuying Wei, Israa Fakih +5VLM EvaluationLLM Evaluation

  14. UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

    Jul 9, 2026Haibin Tian, Huichao Xie, Xuelin Qian +3Multimodal GroundingMultimodal Model Evaluation

  15. Rethinking Multimodal Time-Series Forecasting Evaluation

    Jul 8, 2026Haoxin Liu, Yichen Zhou, Rajat Sen +2Multivariate Time Series ForecastingZero-Shot Time Series Forecasting

  16. Overview of the NLPCC 2026 Shared Task 1: Difficulty-Aware Multilingual and Multimodal Medical Instructional Video Understanding Evaluation

    Jul 7, 2026Shenxi Liu, Kan Li, Mingyang Zhao +2Multimodal IRTemporal Video Grounding

  17. Evaluating and Understanding Model Editing for Medical Vision Language Models

    Jul 6, 2026Guli Zhu, Chenwei Wu, Liyue ShenKnowledge EditingMedical VLMs

  18. Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards

    Jul 6, 2026Tianhao Niu, Ziyu Han, Qiguang Chen +5Data VisualizationCode Generation Evaluation

  19. PPE-Bench: A Benchmark for Evaluating MLLM Unlearning under Private-Public Entanglement

    Jul 3, 2026Xianren Zhang, Delvin Ce Zhang, Dongwon Lee +1Privacy Leakage in Language ModelsMLLM Unlearning

  20. K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos

    Jul 2, 2026Khush Attarde, Yusuf Ali, Megha Thukral +3Video UnderstandingMultimodal Large Language Models