Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding

    May 18, 2026Ruixiang Zhao, Jie Yang, Zijie Xin +4Audio-Visual UnderstandingStreaming Video Understanding

  2. Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction

    May 17, 2026Chaoqun He, Mingyang Xiang, Yingjing Xu +5Multimodal Large Language ModelsMultimodal Agents

  3. EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning

    May 17, 2026Zeyu Wang, Chang Liu, Eduardus Tjitrahardja +22Multimodal Large Language ModelsEgocentric Video Understanding

  4. PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media

    May 16, 2026Zoher Kachwala, Bao Tran Truong, Rasika Muralidharan +3Multilingual Language Model EvaluationContent Moderation

  5. GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions

    May 15, 2026Junho Kim, Xu Cao, Houze Yang +6Multimodal QAMultimodal Model Evaluation

  6. MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory

    May 14, 2026Minghao Guo, Qingyue Jiao, Zeru Shi +14Multimodal MemoryAI Agent Evaluation

  7. Do Composed Image Retrieval Benchmarks Require Multimodal Composition?

    May 14, 2026Matteo Attimonelli, Alessandro De Bellis, Aryo Pradipta Gema +8Benchmark AuditingImage Retrieval

  8. ViMU: Benchmarking Video Metaphorical Understanding

    May 14, 2026Qi Li, Xinchao WangVideo UnderstandingVideo QA

  9. MuteBench: Modality Unavailability Tolerance Evaluation for Incomplete Multimodal Fusion

    May 13, 2026Wugeng Zheng, Ziwen Kan, Tianlong Chen +2Missing-Modality LearningMultimodal Robustness

  10. A Multi-Probe Audit of Clinical-Interview Depression Detection Benchmarks

    May 13, 2026Takehiro Ishikawa, Jon DukeDepression DetectionMental Health

  11. ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence

    May 13, 2026Zhuofan Shi, Peilun Jia, Baoqin Sun +4Multimodal RAGMultimodal Grounding

  12. WinDeskGround: A Benchmark for Robust GUI Grounding in Complex Multi-Window Desktop Environments

    May 13, 2026Haoren Zhao, Tianyi Chen, Zhen WangMultimodal RobustnessGUI Agents

  13. MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence

    May 12, 2026Yifan Chen, Fei Yin, Qingyan Bai +2Multimodal ICLMultimodal Reasoning

  14. MM-OptBench: A Solver-Grounded Benchmark for Multimodal Optimization Modeling

    May 12, 2026Zhong Li, Qi Huang, Yuxuan Zhu +6Multimodal OptimizationSynthetic Benchmark Generation

  15. Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity

    May 12, 2026Abid Ali, Diego Molla-Aliod, Usman NaseemLLM EvaluationMultimodal Large Language Models

  16. GeoR-Bench: Evaluating Geoscience Visual Reasoning

    May 12, 2026Yushuo Zheng, Zicheng Zhang, Huiyu Duan +7Remote Sensing Image UnderstandingGeospatial Reasoning

  17. EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant

    May 11, 2026Zichen Wen, Boxue Yang, Junlong Ke +5Streaming Video UnderstandingSelf-Training

  18. SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation

    May 11, 2026Longteng Guo, Xuanxu Lin, Dongze Hao +5Multimodal Large Language ModelsScientific QA

  19. Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization

    May 11, 2026Yeongtak Oh, Dongwook Lee, Sangkwon Park +2Multimodal GroundingMultimodal Large Language Models

  20. SpecX: A Large-Scale Benchmark for Multi-Modal Spectroscopy and Cross-Paradigm Evaluation

    May 11, 2026Chengrui Xiang, Tengfei Ma, Yujie Chen +3Multimodal Model Evaluation

  21. Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs

    May 10, 2026Jiafeng Liang, Zhihao Zhu, Zihan Zhang +7Causal DiscoveryMultimodal Large Language Models

  22. DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

    May 10, 2026Rui Liu, Dian Yu, Zhenwen Liang +6Multimodal Large Language ModelsMultimodal Reward Modeling

  23. SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning

    May 10, 2026Kun Xiang, Terry Jingchen Zhang, Zirong Liu +15Cross-Modal LearningMultimodal Grounding