Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding

    May 9, 2026Xiang Feng, Jiawei Zhou, Zhangfeng Huang +6LLM GroundingLLM Answer Verification

  2. EmoS: A High-Fidelity Multimodal Benchmark for Fine-grained Streaming Emotional Understanding

    May 9, 2026Pengze Guo, Jingxi Liang, Zhiwen Xie +2Multimodal Large Language ModelsMultimodal Emotion Recognition

  3. Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search

    May 9, 2026Tao Yu, yiming ding, Shenghua Chai +16Multi-Hop QAMultimodal IR

  4. Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare

    May 8, 2026Prasanna Desikan, Harshit Rajgarhia, Shivali Dalmia +1HealthcareBenchmark Design

  5. SYNCR: A Cross-Video Reasoning Benchmark with Synthetic Grounding

    May 8, 2026Sara Ghazanfari, Siddharth Garg, Prashanth Krishnamurthy +1Multimodal GroundingVideo Reasoning

  6. LithoBench: Benchmarking Large Multimodal Models for Remote-Sensing Lithology Interpretation

    May 8, 2026Jun Wang, Fengpeng Li, Hang Dong +2Remote Sensing Image UnderstandingLarge Vision-Language Models

  7. TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos

    May 8, 2026Hengyi Feng, Hao Liang, Mingrui Chen +6Audio-Visual UnderstandingMultimodal Hallucination

  8. InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

    May 8, 2026Bohan Hou, Jiuning Gu, Jiayan Guo +5Multimodal IRMultimodal Search Agents

  9. ChartREG++: Towards Benchmarking and Improving Chart Referring Expression Grounding under Diverse referring clues and Multi-Target Referring

    May 8, 2026Tianhao Niu, Ziyu Han, Xuan Dong +2Referring Image SegmentationVisual Grounding

  10. EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams

    May 8, 2026Dongchuan Ran, Linyu Ou, Xueheng Li +5Egocentric Video UnderstandingAI Agent Benchmarks

  11. Uneven Evolution of Cognition Across Generations of Generative AI Models

    May 7, 2026Isaac Galatzer-Levy, Daniel McDuff, Xin Liu +1Cognitive ModelingMultimodal Model Evaluation

  12. Are We Making Progress in Multimodal Domain Generalization? A Comprehensive Benchmark Study

    May 7, 2026Hao Dong, Hongzhao Li, Shupan Li +3Multimodal RobustnessDomain Generalization

  13. MedHorizon: Towards Long-context Medical Video Understanding in the Wild

    May 7, 2026Bodong Du, Bowen Liu, Yang Yu +8HealthcareMedical VQA

  14. Uncovering Entity Identity Confusion in Multimodal Knowledge Editing

    May 7, 2026Shu Wu, Xiaotian Ye, Xinyu Mou +3Multimodal GroundingMultimodal Large Language Models

  15. TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity

    May 7, 2026Zheyuan Yang, Liqiang Shang, Junjie Chen +6Multimodal RobustnessMultimodal Reasoning

  16. ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models

    May 7, 2026Yuhang Wang, Wenjie Mei, Junkai Zhang +3Privacy-Preserving Language ModelsMultimodal Large Language Models

  17. Unifying Scientific Communication: Fine-Grained Correspondence Across Scientific Media

    May 7, 2026Megha Mariam K. M, Vineeth N. Balasubramanian, C. V. JawaharCross-Modal AlignmentScientific Communication

  18. AstroAlertBench: Evaluating the Accuracy, Reasoning, and Honesty of Multimodal LLMs in Astronomical Classification

    May 7, 2026Claire Chen, Jiabao Sean Xiao, Shuze Daniel Liu +7Multimodal ReasoningMultimodal Model Evaluation

  19. DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning

    May 6, 2026Yuancheng Wei, Haojie Zhang, Linli Yao +7Image CaptioningMultimodal Model Evaluation

  20. Can Multimodal Large Language Models Understand Pathologic Movements? A Pilot Study on Seizure Semiology

    May 5, 2026Lina Zhang, Tonmoy Monsoor, Mehmet Efe Lorasdagi +8Video UnderstandingMultimodal Large Language Models

  21. VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing

    May 5, 2026Andong Deng, Dawei Du, Zhenfang Chen +7Video Editing BenchmarksVideo Editing

  22. From Where Things Are to What They Are For: Benchmarking Spatial-Functional Intelligence in Multimodal LLMs

    May 4, 2026Le Zhang, Jihan Yang, Soundarya Krishnan +11Spatial Reasoning BenchmarksVisual Spatial Reasoning

  23. VIDA: A Dataset for Visually Dependent Ambiguity in Multimodal Machine Translation

    May 3, 2026Jingheng Pan, Xintong Wang, Longyue Wang +3Large Vision-Language ModelsMultimodal Model Evaluation

  24. TMD-Bench: A Multi-Level Evaluation Paradigm for Music-Dance Co-Generation

    May 3, 2026Xiaoda Yang, Majun Zhang, Changhao Pan +10Human Motion GenerationAudio-Visual Synchronization

  25. VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning

    May 3, 2026Zi-Yi Jia, Zi-Jian Cheng, Xin-Yue Zhang +4Benchmark DesignMultimodal Model Evaluation

  26. OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice

    May 2, 2026Rongyang Wang, Shuang Zhou, Jiashuo Wang +2Medical ImagingCognitive Modeling