Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. Are Multimodal LLMs Ready for Clinical Dermatology? A Real-World Evaluation in Dermatology

    May 1, 2026Roy Jiang, Hyunjae Kim, Zhenyue Qin +8HealthcareClinical Triage

  2. Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning

    Apr 30, 2026Junpeng Ding, Zichen Tang, Haihong E +17AI for ScienceVLM Reasoning

  3. COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts

    Apr 30, 2026Bingli Wang, Huanze Tang, Haijun Lv +5Vision-Language ModelsVision-Language Grounding

  4. TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation

    Apr 29, 2026Han Gong, Zhen Zhou, Yunyang Shi +4LLM EvaluationIntelligent Transportation Systems

  5. HotComment: A Benchmark for Evaluating Popularity of Online Comments

    Apr 28, 2026Yafeng Wu, Yunyao Zhang, Liliang Ye +4Social Media AnalysisMultimodal Model Evaluation

  6. VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation

    Apr 28, 2026Divake Kumar, Sina Tayebati, Devashri Naik +2VLM EvaluationVision-Language Models

  7. M3^3-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

    Apr 28, 2026Jiatong Ma, Longteng Guo, Yuchen Liu +4Multimodal RAGVisual Question Answering

  8. Beyond Accuracy: Benchmarking Cross-Task Consistency in Unified Multimodal Models

    Apr 27, 2026Weixing Wang, Liudvikas Zekas, Anton Hackl +5Unified Multimodal ModelsCross-Modal Alignment

  9. Assessing Y-Axis Influence: Bias in Multimodal Language Models on Chart-to-Table Translation

    Apr 27, 2026Seok Hwan Song, Azher Ahmed Efat, Wallapak TavanapongData VisualizationMultimodal Large Language Models

  10. All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation

    Apr 27, 2026Leonardo Haw-Yang Foo, Chih-Kai Yang, Chen-An Li +2Audio-Language Model EvaluationAudio QA

  11. Exploring Audio Hallucination in Egocentric Video Understanding

    Apr 26, 2026Ashish Seth, Xinhao Mei, Changsheng Zhao +9Audio-Visual UnderstandingHallucination in Language Models

  12. ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

    Apr 26, 2026Zichun Guo, Yuling Shi, Wenhao Zeng +6Image ReconstructionMultimodal Large Language Models

  13. FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment

    Apr 26, 2026Sophie Chiang, Tom Brennan, Fethiye Irmak Dogan +2Depression DetectionMedical Diagnosis

  14. EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs

    Apr 25, 2026He Hu, Tengjin Weng, Zebang Cheng +5Multimodal Large Language ModelsMultimodal Model Evaluation

  15. MTT-Bench: Predicting Social Dominance in Mice via Multimodal Large Language Models

    Apr 24, 2026Yunquan Chen, Haoyu ChenMultimodal Large Language ModelsSocial Reasoning

  16. CNSL-bench: Benchmarking the Sign Language Understanding Capabilities of MLLMs on Chinese National Sign Language

    Apr 24, 2026Rui Zhao, Xuewen Zhong, Xiaoyun Zheng +2Multimodal Large Language ModelsSign Language Recognition

  17. Can Multimodal Large Language Models Truly Understand Small Objects?

    Apr 24, 2026Fujun Han, Junan Chen, Xintong Zhu +4Multimodal QAMultimodal Model Evaluation

  18. Beyond Single Plots: A Benchmark for Question Answering on Multi-Charts

    Apr 23, 2026Azher Ahmed Efat, Seok Hwan Song, Wallapak TavanapongData VisualizationMultimodal Large Language Models

  19. ARFBench: Benchmarking Time Series Question Answering Ability for Software Incident Response

    Apr 23, 2026Stephan Xie, Ben Cohen, Mononito Goswami +6Time Series ReasoningTime Series QA

  20. Thinking Like a Botanist: Challenging Multimodal Language Models with Intent-Driven Chain-of-Inquiry

    Apr 22, 2026Syed Nazmus Sakib, Nafiul Haque, Shahrear Bin Amin +4Visual Question AnsweringPlant Disease Classification

  21. ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence

    Apr 22, 2026Menghe Ma, Siqing Wei, Yuecheng Xing +5Optical Music RecognitionMultimodal Reasoning

  22. Exploring Spatial Intelligence from a Generative Perspective

    Apr 22, 2026Muzhi Zhu, Shunyao Jiang, Huanyi Zheng +9Spatial Reasoning BenchmarksUnified Multimodal Models

  23. CHASM: Unveiling Covert Advertisements on Chinese Social Media

    Apr 22, 2026Jingyi Zheng, Tianyi Hu, Yule Liu +5Social Media AnalysisOnline Advertising

  24. CCTVBench: Contrastive Consistency Traffic VideoQA Benchmark for Multimodal LLMs

    Apr 22, 2026Xingcheng Zhou, Hao Guo, Rui Song +5Visual Question AnsweringVideo QA

  25. X-PCR: A Benchmark for Cross-modality Progressive Clinical Reasoning in Ophthalmic Diagnosis

    Apr 22, 2026Gui Wang, Zehao Zhong, YongSong Zhou +6HealthcareMedical Diagnosis

  26. SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark

    Apr 22, 2026Gui Wang, YongSong Zhou, Kaijun Deng +4Spatiotemporal ReasoningHealthcare