Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs

    Jun 24, 2026Yu-Yang Chen, Lan-Zhe GuoSpatial Reasoning BenchmarksVisual Reasoning

  2. Falcon: Functional Assembly and Language for Compositional Reasoning in X-ray

    Jun 24, 2026Yonathan Michael, Mohamad Alansari, Natnael Takele +2Multimodal GroundingMultimodal Reasoning

  3. SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity

    Jun 24, 2026Tianchen Guo, Chen Liu, Ling Chen +1Visual Question AnsweringMulti-View Consistency

  4. MedBench v5: A Dynamic, Process-Oriented, and Hallucination-Aware Benchmark for Clinical Multimodal Models

    Jun 23, 2026Jinru Ding, Chuchu Jiang, Lu Lu +12AI Agent BenchmarksMedical VLMs

  5. ReMMD: Realistic Multilingual Multi-Image Agentic Verification for Multimodal Misinformation Detection

    Jun 23, 2026Chenhao Dang, Dantong Zhu, Jun Yang +2Multimodal AgentsMultimodal Model Evaluation

  6. PIVOTSBench: Evaluating Fine-Grained Interpersonal Relationship Reasoning in Multimodal Large Language Models

    Jun 22, 2026Shuxiang Zhang, Yiting Yin, Wenxuan Song +2Multimodal Large Language ModelsMultimodal Reasoning

  7. Catching Lies Without Sending the Video: Privacy-Preserving Multimodal Deception Detection

    Jun 21, 2026Nikita Sharma, Pranav Sara, Karan SinglaPrivacy-Preserving MLMultimodal Model Evaluation

  8. Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do

    Jun 21, 2026Zhuoran Jin, Kejian Zhu, Hongbang Yuan +5Multimodal ReasoningVLM Reasoning

  9. Efficient Multimodal Clinical Question Answering for Pulmonary Embolism Risk Assessment

    Jun 21, 2026Xiangyuan Xue, Yang Yu, Yan Gao +5Efficient Multimodal InferenceMultimodal QA

  10. T-IMPACT: A Severity-Aware Benchmark for Contextual Image-Text Manipulation

    Jun 21, 2026Gagandeep Singh, Aaditya Yadav, Priyanka SinghMultimodal Model Evaluation

  11. Bayesian Adaptation Gym: A Benchmark for the Bayesian Low-Rank Adaptation of Multi-Modal Language Models

    Jun 20, 2026Colin Samplawski, Ramneet Kaur, Manoj Acharya +2Distribution Shift RobustnessMultimodal Large Language Models

  12. SAGE: An Expert-Annotated South Asian GI Endoscopy Dataset for Multimodal Learning and Hallucination Analysis

    Jun 20, 2026Niyoj Oli, Sachin Acharya, Sandesh Pokhrel +7EndoscopyMedical Imaging

  13. CulMind: Benchmarking Multimodal Understanding and Reasoning in Chinese Cultural Heritage

    Jun 19, 2026Zhangwei Cao, Shuhan Fan, Yuting Wei +5Benchmark ConstructionReasoning Evaluation

  14. Cross-Modal Corroboration for Annotation-Free Wildlife Monitoring

    Jun 19, 2026Bharath Pillai, Varun Viswapriyan, Christopher Stewart +2Animal Behavior AnalysisMultimodal Model Evaluation

  15. StylisticBias: A Few Human Visual Cues Drive Most Social Biases in MLLMs

    Jun 18, 2026Shaghayegh Kolli, Timo Cavelius, Nafiseh Nikeghbal +2Social Bias in Language ModelsMultimodal Large Language Models

  16. ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models

    Jun 18, 2026Yihao Wang, Zijian He, Jie Ren +1Multimodal GroundingMultimodal Reasoning

  17. Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games

    Jun 17, 2026Shengyuan Ding, Xilin Wei, Xinyu Fang +4Multimodal MemorySequential Decision Making

  18. Million-scale multimodal pollen microscopy with expert-guided foundation models

    Jun 16, 2026András Biricz, Björn Gedda, Donát Magyar +4Domain AdaptationMultimodal Model Evaluation

  19. The Slop Paradox: How Synthetic Standardization Erodes Clinical Uncertainty and Cross-Modal Alignment in AI-Rewritten Radiology Reports

    Jun 16, 2026Samar AnsariMedical VLMsVision-Language Alignment

  20. MODE-RAG: Manifold Outlier Diagnosis and Energy-based Retrieval-Augmented Generation Evaluation

    Jun 16, 2026Zehang Wei, Jiaxin Dai, Jiamin Yan +1Multimodal RAGMulti-Agent LLM Systems

  21. Multimodal Evaluator Preference Collapse: Cross-Modal Coupling in Self-Evolving Agents

    Jun 15, 2026Zewen LiuAI Agent EvaluationMultimodal Model Evaluation

  22. UrbanWell: Benchmarking Multimodal Large Language Models for Spatio-Temporal Urban Wellbeing Analytics

    Jun 14, 2026Yanxin Xi, Xiang Su, Jie Feng +3Spatiotemporal ReasoningMultimodal Large Language Models

  23. OmniTraffic: A Controllable Generation Pipeline and Benchmark for Spatio-Temporal Traffic Reasoning

    Jun 14, 2026Maonan Wang, Zhengyan Huang, Kemou Jiang +13Autonomous Driving DatasetsSpatiotemporal Reasoning

  24. On the Adversarial Robustness of Multimodal LLM Judges

    Jun 14, 2026Zihan Wang, Guansong Pang, Zelin Liu +3LLM-as-a-JudgeAdversarial Robustness