Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. WildFireVQA: A Large-Scale Radiometric Thermal VQA Benchmark for Aerial Wildfire Monitoring

    Apr 22, 2026Mobin Habibpour, Niloufar Alipour Talemi, John Spodnik +2Thermal ImagingVisual Question Answering

  2. Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

    Apr 21, 2026Jing Jin, Hao Liu, Yan Bai +9Reasoning EvaluationMultimodal Reasoning

  3. SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models

    Apr 21, 2026Josue Torres-Fonseca, Naihao Deng, Yinpei Dai +5LLM Safety BenchmarksLarge Language Model-Based Robot Planning

  4. Lost in Translation: Do LVLM Judges Generalize Across Languages?

    Apr 21, 2026Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem +5VLM EvaluationMultilingual VLM Evaluation

  5. MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval

    Apr 20, 2026Shaden Alshammari, Kevin Wen, Abrar Zainal +5Mathematical Reasoning BenchmarksMultilingual Language Model Evaluation

  6. Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio Inputs

    Apr 20, 2026Samuel G. Balter, Ethan Jerzak, Connor T. JerzakMultimodal Large Language ModelsMultimodal Reasoning

  7. MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge

    Apr 20, 2026Sua Lee, Sanghee Park, Jinbae ImLLM-as-a-JudgeMultimodal Large Language Models

  8. Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts

    Apr 20, 2026Run Xu, Lu Li, Rongzhao Zhang +1Image CaptioningMultimodal Generation

  9. Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models

    Apr 19, 2026Yunkai Dang, Yifan Jiang, Yizhu Jiang +3Selective PredictionConfidence Estimation in Language Models

  10. Adverse-to-the-eXtreme Panoptic Segmentation: URVIS 2026 Study and Benchmark

    Apr 18, 2026Yiting Wang, Nolwenn Peyratout, Tim Brodermann +13Image SegmentationPanoptic Segmentation

  11. Evaluating Multimodal LLMs for Inpatient Diagnosis: Real-World Performance, Safety, and Cost Across Ten Frontier Models

    Apr 18, 2026Bruce A. Bassett, Amy Rouillard, Sitwala Mundia +8Language Model Safety EvaluationHealthcare

  12. Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models

    Apr 18, 2026Xinru Yan, Boxi Cao, Yaojie Lu +4Unified Multimodal ModelsNeural Network Interpretability

  13. Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap

    Apr 17, 2026Yige Xu, Yongjie Wang, Zizhuo Wu +3Vision-Language ModelsVLM Adaptation

  14. Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs

    Apr 17, 2026Sai Srinivas Kancheti, Aditya Sanjiv Kanade, Vineeth N. Balasubramanian +1Spatial Reasoning BenchmarksVisual Spatial Reasoning

  15. Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

    Apr 17, 2026Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti +2Spatial Reasoning BenchmarksVisual Spatial Reasoning

  16. MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

    Apr 17, 2026Manh Luong, Tamas Abraham, Junae Kim +6LLM Safety BenchmarksLanguage Model Safety Evaluation

  17. ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

    Apr 17, 2026Qiang Xu, Shengyuan Bai, Yu Wang +6Visual ReasoningMultimodal Model Evaluation

  18. RefereeBench: Are Video MLLMs Ready to be Multi-Sport Referees

    Apr 17, 2026Yichen Xu, Yuanhang Liu, Chuhan Wang +5Sports Video AnalysisVideo Reasoning

  19. Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems

    Apr 16, 2026Nishanth Madhusudhan, Vikas Yadav, Alexandre LacosteMultimodal QAMultimodal Reasoning

  20. Rethinking Patient Education as Multi-turn Multi-modal Interaction

    Apr 16, 2026Zonghai Yao, Zhipeng Tang, Chengtao Lin +5Multimodal GroundingHealthcare

  21. Unified Multimodal Uncertain Inference

    Apr 9, 2026Dengjia Zhang, Alexander Martin, William Jurayj +3Probability CalibrationMultimodal Reasoning

  22. Colon-Bench: An Agentic Workflow for Scalable Dense Lesion Annotation in Full-Procedure Colonoscopy Videos

    Mar 26, 2026Abdullah Hamdi, Changchun Yang, Xin GaoVideo Object SegmentationMedical Image Analysis

  23. GeoHeight-Bench: Towards Height-Aware Multimodal Reasoning in Remote Sensing

    Mar 26, 2026Xuran Hu, Zhitong Xiong, Zhongcheng Hong +3Remote Sensing Image UnderstandingLarge Vision-Language Models

  24. UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy

    Mar 25, 2026Yicheng Xu, Jiangning Zhang, Zhucun Xue +5Multimodal ICLUnified Multimodal Models

  25. OmniACBench: A Benchmark for Evaluating Context-Grounded Acoustic Control in Omni-Modal Models

    Mar 25, 2026Seunghee Kim, Bumkyu Park, Kyudan Jung +5Multimodal GroundingUnified Multimodal Models