Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. Evaluating and Understanding Model Editing for Medical Vision Language Models

    Jul 6, 2026Guli Zhu, Chenwei Wu, Liyue ShenKnowledge EditingMedical VLMs

  2. Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards

    Jul 6, 2026Tianhao Niu, Ziyu Han, Qiguang Chen +5Data VisualizationCode Generation Evaluation

  3. PPE-Bench: A Benchmark for Evaluating MLLM Unlearning under Private-Public Entanglement

    Jul 3, 2026Xianren Zhang, Delvin Ce Zhang, Dongwon Lee +1Privacy Leakage in Language ModelsMLLM Unlearning

  4. K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos

    Jul 2, 2026Khush Attarde, Yusuf Ali, Megha Thukral +3Video UnderstandingMultimodal Large Language Models

  5. EduArt: An educational-level benchmark for evaluating art history knowledge in large language models

    Jul 2, 2026Gianmarco Spinaci, Lukas Klic, Giovanni ColavizzaEducational AssessmentMultimodal QA

  6. MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

    Jul 2, 2026Yuanzhi Liu, Shousheng Zhao, Bo Zhou +2VLM EvaluationBenchmark Construction

  7. MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding

    Jul 2, 2026Yuan Wang, Shujian Gao, Songtao Jiang +2Video UnderstandingStreaming Video Understanding

  8. AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization

    Jul 1, 2026Tianhong Zhou, Mingyang Han, Boyu Li +8Audio-Visual SynchronizationAudio-Visual Alignment

  9. EgoGapBench: Benchmarking Egocentric Action Selection in Multi-Agent Scenes

    Jul 1, 2026Jihyeok Jung, Jeewu Lee, Sanghyeop Kim +2Egocentric Video UnderstandingAI Agent Benchmarks

  10. MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments

    Jun 30, 2026Qingyun Liu, Jiwen Zhang, Jingyi Hu +2Multi-Agent CollaborationAI Agent Benchmarks

  11. Learning to Deny: Action Denial in Multimodal Large Language Models

    Jun 30, 2026Raiyaan Abdullah, Shehreen Azad, Yogesh Singh RawatMultimodal Large Language ModelsCausal Reasoning in Videos

  12. OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning

    Jun 29, 2026Haocong He, Chenfei Liao, Zichen Wen +13Visual Spatial ReasoningMultimodal Large Language Models

  13. Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation

    Jun 29, 2026Chonghuinan Wang, Zhikai Chen, Chunwei Wang +9Unified Multimodal ModelsMultimodal Model Evaluation

  14. MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

    Jun 29, 2026Yuxuan Fan, Gyusik Seo, Jing Hao +3Audio-Visual UnderstandingMultimodal Large Language Models

  15. Making Multimodal LLMs Reliable Chart Data Extractors: A Benchmark and Training Framework

    Jun 29, 2026Yuchen He, Peizhi Ying, Liqi Cheng +4Document Information ExtractionMultimodal Large Language Models

  16. Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

    Jun 29, 2026Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie +2Language Model Generation EvaluationMultimodal Reasoning

  17. Reliability-Prioritized Fine-Grained Generation in Multimodal Large

    Jun 28, 2026Xiaomeng Fan, Wei Wu, Yuwei Wu +9Direct Preference OptimizationMultimodal Large Language Models

  18. PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

    Jun 26, 2026Yana Wei, Hongbo Peng, Yanlin Lai +14Rubric-Based EvaluationAutomated Evaluation

  19. AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration

    Jun 26, 2026Haotian Li, Yida Wang, Leyuan Wang +7Multi-View ConsistencyMultimodal Reasoning

  20. HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models

    Jun 25, 2026Jiajun Wu, Haoyu Kang, Yining Sun +13Video UnderstandingVideo Content Moderation

  21. Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation

    Jun 25, 2026Jinyu Liu, Xincheng Shuai, Henghui Ding +1Unified Multimodal ModelsMultimodal Foundation Models

  22. Evaluation Pitfalls and Challenges in Multimedia Event Extraction

    Jun 25, 2026Philipp Seeberger, Steffen Freisinger, Tobias Bocklet +1Multimodal GroundingMultimodal Model Evaluation

  23. DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues

    Jun 25, 2026Geng Li, Yuxin PengVisual ReasoningMultimodal Large Language Models

  24. What We are Missing in Multimodal LLM Evaluation?

    Jun 24, 2026Po-han Li, Shenghui Chen, Sandeep Chinchali +1Spatiotemporal ReasoningMultimodal Large Language Models