Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. PathView-Bench: Can Multimodal Large Language Models Achieve Fine-grained Multiscale Understanding of Pathology Images?

    Jul 30, 2026Zongyi Chen, Yu Liang, Jie Lin +1Computational PathologyMedical VQA

  2. MMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware

    Jul 30, 2026Xianpeng Zhang, Jiahua Yang, Dongyu Chen +7Multimodal Large Language ModelsMultimodal Model Evaluation

  3. MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos

    Jul 30, 2026Jinpeng Hu, Erqiang Wang, Shan Wang +4Mental HealthMultimodal Large Language Models

  4. MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models

    Jul 30, 2026Wenjie Zhu, Yabin Zhang, Wenjun Zeng +1VLM RobustnessMultimodal Large Language Models

  5. Talked Out of the Truth: Sycophancy in the Reasoning Chains of Multimodal Models

    Jul 30, 2026Mahir Numayeer Islam, Gakuto Okuyama, Nikolaus Siauw +3LLM SycophancyMultimodal CoT Reasoning

  6. AHA-Memes: A Fine-Grained Multimodal Benchmark for Understanding Hate in Arabic Memes

    Jul 29, 2026Mohamed Bayan Kmainasi, Ali Ezzat Shahroor, Abul Hasnat +3Arabic NLPHate Speech Detection

  7. SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context

    Jul 29, 2026Zihan Deng, Chuanzhi Xu, Huiqi Liang +3Automated EvaluationImage Quality Assessment

  8. ICDAR 2026 Competition on Information Extraction from Atomic Layer Deposition/Etching (ALD/E) Scientific Figures

    Jul 29, 2026Fahad Ahmed, Sören Auer, Jennifer D'SouzaVisual Question AnsweringDocument Information Extraction

  9. See2Think: Do Multimodal Models Really Use Intermediate Visual States?

    Jul 29, 2026Siyu Yan, Zhuoran Yan, Haiying Xu +10Visual ReasoningMultimodal Reasoning

  10. SafeBuild-Bench: A Temporal-Robust Construction Safety Benchmark with Graph-Enhanced Data Mining

    Jul 29, 2026Yi Cui, Zilin Wang, Yijie Xu +5Multimodal RobustnessBenchmark Construction

  11. MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning

    Jul 29, 2026Kawai Chung, Chunkit Chan, Yauwai Yim +12Multimodal ReasoningMultimodal Model Evaluation

  12. Symphony of Bias: Exploring Gender Associations with Musical Instruments in Multimodal LLMs

    Jul 29, 2026Farhan Farsi, Shayan Bali, Mohammad Heydari Rad +2Gender Bias in Language ModelsMultimodal Large Language Models

  13. Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases

    Jul 28, 2026Rui Yang, Weihao Xuan, Yi Lin +23Medical VLMsMulti-Turn Dialogue Evaluation

  14. CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

    Jul 28, 2026Lai Wei, Chengqi Li, Jiapeng Li +3Multimodal GroundingMultimodal ICL

  15. Neurai-VN Benchmark: Standardized Machine Learning Models for Multimodal Digital Phenotyping in Mental Health Classification

    Jul 28, 2026Quoc-Cuong Pham, Hoang-Thuy-Duong Vu, Thi-Thanh-Huong Ha +1Depression DetectionMental Health

  16. ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding

    Jul 27, 2026Hangjie Yuan, Yichen Qian, Zhiwei Tang +21Medical Report GenerationMedical VQA

  17. Task-Conditional Faithfulness Auditing of Multimodal LLMs for Grid Diagnosis

    Jul 27, 2026Tianqiao Zhao, Meng Yue, Jianhui WangLLM AuditingMultimodal Model Evaluation

  18. StanceFlip: A Comprehensive Multi-Dimensional Benchmark for Multimodal Conversational Stance Flipping Forecasting

    Jul 27, 2026Heyan Chai, Xin Li, Wenjie Wang +5Multimodal ReasoningMultimodal Model Evaluation

  19. A Controlled Visual-Backbone Benchmark for Multimodal Short-Term Solar Irradiance Forecasting

    Jul 26, 2026Oshadha Samarakoon, Dushan Herath, Ishara Ranmandala +4Vision TransformerTime Series Forecasting

  20. Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking

    Jul 26, 2026Haorui He, Xinwen Chen, Dacheng Wen +3Benchmark ContaminationAutomated Fact-Checking

  21. Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests

    Jul 24, 2026Patrick Rim, Tom Long, Ekta Prashnani +6Spatial Reasoning BenchmarksVisual Spatial Reasoning

  22. RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding

    Jul 24, 2026Jianqin Liu, Weiwei Cao, Wanxing Chang +7Radiology VLMsMedical Image Grounding

  23. Benchmarking Fine-tuning and Retrieval Strategies for a Multimodal Language Model on the NRC Reactor Operator Licensing Examination

    Jul 24, 2026Isak Hwang, Yoon Pyo LeeRetrieval-Augmented GenerationLLM Fine-Tuning

  24. Unlearning Under Imbalance: Benchmarking Fairness in Multimodal LLM Unlearning

    Jul 23, 2026Lorenzo Orsingher, Thomas De Min, Massimiliano Mancini +2VLM UnlearningAlgorithmic Fairness

  25. Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?

    Jul 22, 2026Qiwei Ma, Chunping Qiu, Xinjun Cheng +5Remote Sensing Image UnderstandingRemote Sensing VQA

  26. MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Construction

    Jul 22, 2026Yue Zhao, Hongxu Liu, Feiyu Wang +5Data VisualizationCode Generation