Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. FitAQA: A Benchmark of Fitness Action Quality Assessment for Multimodal Large Language Models

    Aug 9, 2026Kaili Zheng, Kaiwen Wang, Xun Zhu +3Multimodal Large Language ModelsAction Quality Assessment

  2. TomaMMU: A Comprehensive Multimodal Understanding Benchmark for Tomato Leaf Diseases

    Aug 9, 2026Gia-Han Truong, Khang Nguyen Quoc, Luyl-Da QuachVision-Language ModelsPlant Disease Classification

  3. Locating Failure in Multi-Page Visually Rich Document Understanding: An Empirical Attribution

    Aug 8, 2026Lewei Xu, Yihao Ding, Zihan Xu +5Document UnderstandingMultimodal Reasoning

  4. LMM Modality Transfer: A Pre-requisite for Autonomous GIS Agents

    Aug 7, 2026Ivan Majic, Zexian Huang, Franziska Hübl +5Cross-Modal AlignmentMultimodal Large Language Models

  5. Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery

    Aug 7, 2026Taolin Han, Yuchen Zhang, Jinghang Wang +22Scientific ReasoningScientific Discovery

  6. Can MLLMs Decode the Creative Leap? Introducing C4 for Cross-Concept Understanding

    Aug 6, 2026Ming Wang, Yuqing Zhang, Tingna Xie +5Creativity AssessmentMultimodal Large Language Models

  7. Seeing Is Not Deciding: Can Multimodal LLMs Act as Effective CEOs?

    Aug 6, 2026Yuyang Dai, Xueqing Peng, Yuxia Wang +2Multimodal GroundingLLM Decision-Making

  8. M3^3R-Bench: A Unified Benchmark for Evidence-Grounded Multimodal Metaphor Understanding

    Aug 6, 2026Hong Jiang, Junnan Zhu, Jingwang Huang +9Figurative Language UnderstandingMultimodal Reasoning

  9. C3^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models

    Aug 5, 2026Swapnanil Mukherjee, Agyeya Negi, Tanuja Ganu +1Modality ImbalanceMultimodal Reasoning

  10. RESPClinBench: Benchmarking Multimodal Clinical Decision-Making and Longitudinal Disease Management in Respiratory Specialty Care

    Aug 5, 2026Mouxiao Bian, Zhi Chen, Ruiyao Chen +8LLM Safety BenchmarksHealthcare

  11. SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models

    Aug 4, 2026Sirun Li, Minghao Liu, Ling Dai +4VLM RobustnessMultimodal Large Language Models

  12. GEB-Bench: Abstract Structures Told in Many Voices

    Aug 4, 2026Tong Zhang, Zhiyuan Shi, Yun Peng +1Analogical ReasoningMultimodal Reasoning

  13. Geo-Embed: Towards Unified Multimodal Embeddings for Urban Understanding

    Aug 4, 2026Jiapeng Li, Yong Li, Junjie Zhou +2Geospatial Representation LearningCross-Modal Retrieval

  14. KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation

    Aug 4, 2026Ruihan Li, Jiyang Tan, Kailin Jiang +5Multimodal HallucinationMultimodal Model Evaluation

  15. Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation

    Aug 4, 2026Khai-Nguyen Nguyen, Oscar Chaparro, Antonio MastropaoloCode GenerationMultimodal Large Language Models

  16. ChartAnno: Benchmarking Multimodal Large Language Models for Chart Annotation Generation

    Aug 4, 2026Zhenghan Chen, Zekai Shao, Lidan Tan +10Data VisualizationMultimodal Large Language Models

  17. ArtECulture: Benchmarking Culture-Conditioned Visual Emotion Understanding in Multimodal Large Language Models

    Aug 4, 2026Xiaolin Chen, Xuemeng Song, Wenhao Shi +3Multimodal Large Language ModelsMultimodal Emotion Recognition

  18. MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing

    Aug 3, 2026Zitong Xu, Huiyu Duan, Xinyun Zhang +7Image Editing EvaluationText-Guided Image Editing

  19. SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation

    Aug 3, 2026Yiming Wang, Ye Chen, Hanqi Chen +1Multimodal Model Evaluation

  20. Decoupling semantics from vision: A framework for faithful visual-text compression evaluation

    Aug 3, 2026Yonghan Gao, Zehong Chen, Lijian Xu +3Multimodal Model EvaluationVisual Token Compression

  21. LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning

    Aug 2, 2026Ziyan Xiao, Yinghao Zhu, Wenting Zhang +2Data VisualizationVisual Reasoning

  22. FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

    Jul 31, 2026Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino +2ClassificationMultimodal Model Evaluation

  23. LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger

    Jul 30, 2026Enjun Du, Hange Zhou, Chenxu Du +4Multimodal GroundingMultimodal QA