Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation

    May 28, 2026Chenghao Zhang, Guanting Dong, Yufan Liu +3Multimodal GenerationMultimodal Agents

  2. OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields

    May 28, 2026Wanhao Liu, Jiaqing Xie, Qian Tan +10Benchmark DesignScientific QA

  3. CardioLens: Revealing the Clinical Reality Gap of MLLMs via Multi-Sequence Cardiac MRI Evaluations

    May 28, 2026Zixian Su, Hongkai Zhang, Fan Gao +12Magnetic Resonance ImagingMedical VLMs

  4. OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

    May 27, 2026Xinchen Zhang, Bowei Liu, Jiale Liu +7Multimodal Large Language ModelsReinforcement Learning with Verifiable Rewards

  5. IPO-Mine: A Toolkit and Dataset for Section-Structured Analysis of Long, Multimodal IPO Documents

    May 27, 2026Michael Galarnyk, Siddharth Lohani, Vidhyakshaya Kannan +8Document Information ExtractionMultimodal Model Evaluation

  6. MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation

    May 27, 2026Haitian Li, Yanghao Zhou, Heyan Huang +15Audio-Video GenerationMultimodal Model Evaluation

  7. Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models

    May 26, 2026Oscar Chew, Serhii Honcharenko, Qian-Hui Chen +4Temporal Video GroundingVideo-Language Model Evaluation

  8. ChartAct: A Benchmark for Dynamic Chart Understanding

    May 26, 2026Muye Huang, Lin Wu, Lingling Zhang +5Data VisualizationChart QA

  9. LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?

    May 26, 2026Xiaohan Wang, Mingze Yin, Yilin Zhao +2Mathematical Reasoning BenchmarksEducational Assessment

  10. RAPTOR+: A Visually Grounded Vision-Language Framework to Improve Clinical Trust and Auditability in Automated Cancer Referral Processing

    May 25, 2026Sofiat Abioye, Ufaq Khan, Shazad Ashraf +4Document UnderstandingHealthcare

  11. Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning

    May 25, 2026Longteng Guo, Yifan Wang, Pengkang Huo +4Visual ReasoningVLM Reasoning

  12. OmniEgo-R2^2: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

    May 23, 2026Zixu Li, Zhiwei Chen, Zhiheng Fu +4Egocentric Video QAEgocentric Video Understanding

  13. ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models

    May 22, 2026Fen Wang, Zekai Shao, Qiman Kang +5Data VisualizationMultimodal Large Language Models

  14. DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs

    May 22, 2026Jiazhen Pan, Weixiang Shen, Jun Li +7Medical ImagingRadiology VLMs

  15. RE-TRIANGLE: Does TRIANGLE Enable Multimodal Alignment Beyond Cosine Similarity in Retrieval?

    May 22, 2026Arijit Ghosh, Aritra Bandyopadhyay, Chiranjeev Bindra +1Cross-Modal LearningCross-Modal Alignment

  16. Emotion Recognition in Sign Language Conversation

    May 22, 2026Yusong Wang, Keyu Mao, Takao Obi +2Emotion Recognition in ConversationsSign Language Recognition

  17. Pointwise Metrics Mislead: An Evaluation Protocol for Multimodal Inverse Problems

    May 21, 2026Mads H. Baattrup, Jörn Bach, Laurids Jeppe +4Bayesian Inverse ProblemsMultimodal Model Evaluation

  18. AgroTools: A Benchmark for Tool-Augmented Multimodal Agents in Agriculture

    May 21, 2026Zi Ye, Yibin Wen, Xiaoya Fan +10AI Agent BenchmarksTool-Using Vision-Language Agents

  19. Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?

    May 21, 2026Caixin Kang, Tianyu Yan, Sitong Gong +8LLM GroundingPersonality Modeling in Language Models

  20. Seizure-Semiology-Suite (S3): A Clinically Multimodal Dataset, Benchmark, and Models for Seizure Semiology Understanding

    May 21, 2026Lina Zhang, Tonmoy Monsoor, Peizheng Li +23Video UnderstandingMultimodal Large Language Models

  21. EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs

    May 19, 2026Yang Dai, Dian Jiao, Tianwei Lin +1Egocentric Video QACoT Reasoning

  22. MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems

    May 19, 2026Quanxing Xu, Yuhao Tian, Ling Zhou +4Visual Question AnsweringAutomated Software Testing

  23. HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding

    May 19, 2026Mengqi Shi, Haopeng ZhangMultimodal GroundingVideo Summarization