Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. Conditional Multi-Event Temporal Grounding in Long-Form Video

    Jun 13, 2026Yuanhao Zou, Arthad Kulkarni, Lucas Tonanez +12Temporal Video GroundingLong-Video Understanding

  2. MVEB: Massive Video Embedding Benchmark

    Jun 12, 2026Adnan El Assadi, Roman Solomatin, Isaac Chung +13Multimodal EmbeddingVideo Representation Learning

  3. ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning

    Jun 12, 2026Sicheng Yang, Hangjie Yuan, Wenjun Zhang +5Multimodal HallucinationClinical Reasoning

  4. Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

    Jun 12, 2026Daniel Lee, Harsh Sharma, Eunkyu Park +5LLM-as-a-JudgeLanguage Model Calibration

  5. IndustryBench-MIPU: Benchmarking Multi-Image Attribute Value Extraction for Industrial Products

    Jun 12, 2026Haonan Qi, Jin Cao, Yongqi Zhang +9Multimodal Large Language ModelsMultimodal Model Evaluation

  6. Emerging Flexible Designs for Geospatial Multimodal Foundation Models

    Jun 10, 2026Philipe Dias, Waqwoya Abebe, Abhishek Potnis +4Geospatial Foundation ModelsMultimodal Foundation Models

  7. MMClima: A Framework for Multimodal Climate Science Data and Evaluation

    Jun 8, 2026Muhammad Umer Sheikh, Hassan Abid, Khawar Shehzad +2Climate ScienceScientific QA

  8. TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs

    Jun 8, 2026Momina Ahsan, Sarfraz Ahmad, Ming Shan Hee +2Document UnderstandingTable QA

  9. Streaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur?

    Jun 8, 2026Apratim Bhattacharyya, Shweta Mahajan, Sanjay Haresh +5LLM Fine-TuningSynthetic Data Generation

  10. IMUG-Bench: Benchmarking Unified Multimodal Models on Interleaved Understanding and Generation

    Jun 8, 2026Lingyi Meng, Zecong Tang, Haoran Li +12Unified Multimodal ModelsMultimodal Generation

  11. Unveiling Privacy Risks in Multi-modal Large Language Models: Task-specific Vulnerabilities and Mitigation Challenges

    Jun 8, 2026Tiejin Chen, Pingzhi Li, Kaixiong Zhou +2Multimodal Large Language ModelsPrivacy Leakage in Language Models

  12. OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning

    Jun 7, 2026Jiahao Wang, An Ping, Yanghai Wang +13Video CaptioningMultimodal Generation

  13. When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understanding

    Jun 6, 2026Yiheng Wang, Yueqian Lin, Lichen Zhu +3Multimodal Large Language ModelsQuestion Answering

  14. ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?

    Jun 6, 2026Bin Zhu, Yanhao Jia, Kexin Zhao +12Physical ReasoningMultimodal QA

  15. REACT 2026: The Fourth Multiple Appropriate Facial Reaction Generation Challenge: Personalised MAFRG and Appropriate EEG Reaction Prediction

    Jun 6, 2026Siyang Song, Micol Spitale, Zijian Wu +11Conditional Image GenerationMultimodal Generation

  16. From Vision to Text: A Compact Multimodal Approach for Robust, Cross-Domain Presentation Attack Detection on ID Cards

    Jun 5, 2026Qingwen Zeng, Juan E. Tapia, Sneha Das +1Multimodal RobustnessDomain Generalization

  17. MMLongEmbed: Benchmarking Multimodal Embedding Models in Long-Context Scenarios

    Jun 5, 2026Haitian Wang, Ruoxi Sun, Quantong Qiu +5Multimodal IRMultimodal Embedding

  18. MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models

    Jun 4, 2026Ryan D'Cunha, Alejandro Lozano, Xiaoxiao Sun +17Medical Image AnalysisMedical VLMs

  19. DisasterBench: A Multimodal Benchmark for UAV-Based Disaster Response in Complex Environments

    Jun 4, 2026Tan Zhang, Quanyou Li, Lu Zhang +3Efficient Multimodal InferenceMultimodal Reasoning

  20. WorldBench: A Challenging and Visually Diverse Multimodal Reasoning Benchmark

    Jun 4, 2026Yida Yin, Harish Krishnakumar, Chung Peng Lee +9Multimodal Large Language ModelsMultimodal Reasoning

  21. UniCAD: A Unified Benchmark and Universal Model for Multi-Modal Multi-Task CAD

    Jun 3, 2026Jingyuan Chen, Sheng Jin, Haopeng Sun +23D ReconstructionMultimodal Large Language Models

  22. M3^3Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks

    Jun 3, 2026Jie Huang, Ruixun Liu, Sirui Sun +4Multimodal MemoryMultimodal Model Evaluation

  23. A Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs

    Jun 3, 2026Huangchen Xu, Yuan Wu, Yi ChangMultimodal Large Language ModelsMultimodal Model Evaluation

  24. FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs

    Jun 2, 2026Eshika Khandelwal, Jingjing Pan, Mingfang Zhang +3Multimodal GroundingVideo Object Detection

  25. VAMPS: Visual-Assisted Mathematical Problem Solving Benchmark

    Jun 2, 2026Amirhossein Dabiriaghdam, Shayan Vassef, Mohammadreza Bakhtiari +5Mathematical Reasoning BenchmarksMathematical Reasoning