Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs

    Jun 2, 2026Yifei Li, Pengyiang Liu, Yuhang Zang +4Spatial Reasoning BenchmarksSpatiotemporal Reasoning

  2. SLU-2K: A Question-Based Benchmark for Semantic Evaluation of Sign Language Translation

    Jun 2, 2026Zeno Testa, Antonino Furnari, Lorenzo Baraldi +1Sign Language TranslationVideo QA

  3. Towards Characterizing Scientific Image Utility and Upgradability

    Jun 2, 2026WenZhe Li, Qihang Yan, Liang Chen +6Image Quality AssessmentMultimodal Model Evaluation

  4. WebRISE: Requirement-Induced State Evaluation for MLLM-Generated Web Artifacts

    Jun 2, 2026Yuxin Meng, Yuhan Suo, Junjie Wang +9Automated Software TestingAutomated Evaluation

  5. AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

    Jun 1, 2026Yaoting Wang, Ziyi Zhang, Wenming Tu +10Audio-Visual UnderstandingMultimodal Robustness

  6. Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling

    Jun 1, 2026Seojeong Park, Jiho Choi, Junyong Kang +3Reward ModelingLLM-as-a-Judge

  7. X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding

    Jun 1, 2026Peiwen Sun, Xudong Lu, Huadai Liu +10Streaming Video UnderstandingMultimodal Model Evaluation

  8. PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning

    Jun 1, 2026Yusong Zhao, Yuejin Xie, Youliang Yuan +4Traffic Accident AnticipationVideo-Language Models

  9. TVIR: Building Deep Research Agents Towards Text-Visual Interleaved Report Generation

    Jun 1, 2026Xinkai Ma, Zhiqi Bai, Dingling Zhang +21Deep Research AgentsAI Agent Benchmarks

  10. Jailbreaking Multimodal Large Language Models using Multi-Clip Video

    Jun 1, 2026Choongwon Kang, Seungjong Sun, Hyunmin Jun +1Multimodal RobustnessVideo-Language Models

  11. Encoded but Not Routed: Explaining the Table-Chart Gap in Scientific Claim Verification

    Jun 1, 2026Sunisth Kumar, Xanh Ho, Tim Schopf +3VLM InterpretabilityChart Understanding

  12. When Meaning Travels: A Granular Lens on Hybrid-MoE's Role in Idiomatic Understanding for Language Models

    Jun 1, 2026Sarmistha Das, Vaibhav Vishal, Shreyas Guha +3Mixture-of-Experts Language ModelsLow-Resource Language Processing

  13. ChartArena: Benchmarking Chart Parsing across Languages, Scenarios, and Formats

    May 31, 2026Shangpin Peng, Gengluo Li, Xingyu Wan +10VLM EvaluationData Visualization

  14. ProductWebGen: Benchmarking Multimodal Product Webpage Generation

    May 31, 2026Zhihong Liu, Siqi Kou, Zheng Li +5Web Application GenerationUnified Multimodal Models

  15. MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue

    May 30, 2026Yue Jiang, Xue Jiang, Lihua Zhang +6Multimodal Large Language ModelsMultimodal Hallucination

  16. Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs

    May 30, 2026Xin Gao, Cheng Yang, Chufan Shi +1Knowledge EditingUnified Multimodal Models

  17. When Are Multimodal Predictions Biologically Supported? A Diagnostic Evaluation Framework

    May 29, 2026Dylan Steiner, Gustavo Arango-Argoty, Gerald Sun +1Pathology Foundation ModelsMultimodal Embedding

  18. FAM-Bench: A Multimodal Benchmark for Condition-Aware Food-as-Medicine Reasoning

    May 29, 2026Mingyang Mao, Bhargav Rishi Medisetti, Utkarsh Grover +4HealthcareClinical Decision Support

  19. ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models

    May 29, 2026Kaiwen Xue, Tao Wei, Guoxin Zhang +5Spatial Reasoning BenchmarksVisual Spatial Reasoning

  20. TeachObs: A Human-Validated Benchmark for Multimodal Teaching Observation and Model Evaluation

    May 29, 2026Yeil Jeong, Youngjin Yoo, Jiyoung Bae +5Video UnderstandingAI in Education

  21. Your Multimodal Speech Model Says I Have a Face for Radio

    May 28, 2026Maya K. Nachesa, Vlad Niculae, Vagrant GautamASR EvaluationDemographic Bias in ASR

  22. Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation

    May 28, 2026Chenghao Zhang, Guanting Dong, Yufan Liu +3Multimodal GenerationMultimodal Agents

  23. OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields

    May 28, 2026Wanhao Liu, Jiaqing Xie, Qian Tan +10Benchmark DesignScientific QA

  24. CardioLens: Revealing the Clinical Reality Gap of MLLMs via Multi-Sequence Cardiac MRI Evaluations

    May 28, 2026Zixian Su, Hongkai Zhang, Fan Gao +12Magnetic Resonance ImagingMedical VLMs