Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. Unlearning Under Imbalance: Benchmarking Fairness in Multimodal LLM Unlearning

    Jul 23, 2026Lorenzo Orsingher, Thomas De Min, Massimiliano Mancini +2VLM UnlearningAlgorithmic Fairness

  2. Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?

    Jul 22, 2026Qiwei Ma, Chunping Qiu, Xinjun Cheng +5Remote Sensing Image UnderstandingRemote Sensing VQA

  3. MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Construction

    Jul 22, 2026Yue Zhao, Hongxu Liu, Feiyu Wang +5Data VisualizationCode Generation

  4. MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings

    Jul 21, 2026Ziyi Wang, Yuhang Wu, Dongxu Piao +3Theory of MindMultimodal Large Language Models

  5. Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges

    Jul 21, 2026Tuo Liang, Zhe Hu, Disheng Liu +2Multimodal Large Language ModelsComputational Creativity

  6. Style over Substance: A Shortcut Audit of Emotion-Description Preference Evaluation

    Jul 20, 2026Jiabing Yang, Yixiang Chen, Yuan Xu +6Human Preference EvaluationPairwise Preference Evaluation

  7. Now We Know? A Systematic Comparison of TerraMind and THOR

    Jul 20, 2026Frederick Schindlegger, Kenzo Bounegta, Eva Gmelich Meijling +5Geospatial Foundation ModelsRemote Sensing

  8. Can Multimodal Large Language Models Understand OCT?

    Jul 18, 2026Baochen Fu, Wenzhi Deng, Baihao Jin +5Medical ImagingMedical Image Analysis

  9. Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs

    Jul 17, 2026Like Liu, Zhengzheng Xu, Haitao He +3Multimodal GroundingAerial Robotics

  10. SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification

    Jul 17, 2026Bibesh Pyakurel, M. G. Sarwar MurshedBiometric IdentificationMultimodal Large Language Models

  11. Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions

    Jul 16, 2026Yijiang Li, Huiqi Zou, Bingyang Wang +1VLM EvaluationVLM Hallucination

  12. AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

    Jul 14, 2026Yanghai Wang, Jiahao Wang, Jiafu Tang +9Audio-Visual UnderstandingAudio-Visual Alignment

  13. Beyond the Single Camera: Agentic Multi-View Reasoning in Sports Video Understanding

    Jul 13, 2026Kerui Chen, Jinglu Wang, Xiaoyi Zhang +1Active PerceptionSports Video Analysis

  14. Capabilities of Claude Fable 5 on Biomedical Challenge Problems

    Jul 12, 2026Dominic Okonkwo, Magnus Hodgson, Temitope I. David +1Biomedical QALLM Refusal Behavior

  15. MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation

    Jul 10, 2026Runhan Shi, Quan Zhou, Yuqian Xu +14HealthcareClinical Language Model Evaluation

  16. Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

    Jul 9, 2026Matteo Santelmo, Xiuying Wei, Israa Fakih +5VLM EvaluationLLM Evaluation

  17. UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

    Jul 9, 2026Haibin Tian, Huichao Xie, Xuelin Qian +3Multimodal GroundingMultimodal Model Evaluation

  18. Rethinking Multimodal Time-Series Forecasting Evaluation

    Jul 8, 2026Haoxin Liu, Yichen Zhou, Rajat Sen +2Multivariate Time Series ForecastingZero-Shot Time Series Forecasting

  19. Overview of the NLPCC 2026 Shared Task 1: Difficulty-Aware Multilingual and Multimodal Medical Instructional Video Understanding Evaluation

    Jul 7, 2026Shenxi Liu, Kan Li, Mingyang Zhao +2Multimodal IRTemporal Video Grounding