Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

    May 27, 2026Xinchen Zhang, Bowei Liu, Jiale Liu +7Multimodal Large Language ModelsReinforcement Learning with Verifiable Rewards

  2. IPO-Mine: A Toolkit and Dataset for Section-Structured Analysis of Long, Multimodal IPO Documents

    May 27, 2026Michael Galarnyk, Siddharth Lohani, Vidhyakshaya Kannan +8Document Information ExtractionMultimodal Model Evaluation

  3. MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation

    May 27, 2026Haitian Li, Yanghao Zhou, Heyan Huang +15Audio-Video GenerationMultimodal Model Evaluation

  4. Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models

    May 26, 2026Oscar Chew, Serhii Honcharenko, Qian-Hui Chen +4Temporal Video GroundingVideo-Language Model Evaluation

  5. ChartAct: A Benchmark for Dynamic Chart Understanding

    May 26, 2026Muye Huang, Lin Wu, Lingling Zhang +5Data VisualizationChart QA

  6. LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?

    May 26, 2026Xiaohan Wang, Mingze Yin, Yilin Zhao +2Mathematical Reasoning BenchmarksEducational Assessment

  7. RAPTOR+: A Visually Grounded Vision-Language Framework to Improve Clinical Trust and Auditability in Automated Cancer Referral Processing

    May 25, 2026Sofiat Abioye, Ufaq Khan, Shazad Ashraf +4Document UnderstandingHealthcare

  8. Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning

    May 25, 2026Longteng Guo, Yifan Wang, Pengkang Huo +4Visual ReasoningVLM Reasoning

  9. OmniEgo-R2^2: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

    May 23, 2026Zixu Li, Zhiwei Chen, Zhiheng Fu +4Egocentric Video QAEgocentric Video Understanding

  10. ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models

    May 22, 2026Fen Wang, Zekai Shao, Qiman Kang +5Data VisualizationMultimodal Large Language Models

  11. DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs

    May 22, 2026Jiazhen Pan, Weixiang Shen, Jun Li +7Medical ImagingRadiology VLMs

  12. RE-TRIANGLE: Does TRIANGLE Enable Multimodal Alignment Beyond Cosine Similarity in Retrieval?

    May 22, 2026Arijit Ghosh, Aritra Bandyopadhyay, Chiranjeev Bindra +1Cross-Modal LearningCross-Modal Alignment

  13. Emotion Recognition in Sign Language Conversation

    May 22, 2026Yusong Wang, Keyu Mao, Takao Obi +2Emotion Recognition in ConversationsSign Language Recognition

  14. Pointwise Metrics Mislead: An Evaluation Protocol for Multimodal Inverse Problems

    May 21, 2026Mads H. Baattrup, Jörn Bach, Laurids Jeppe +4Bayesian Inverse ProblemsMultimodal Model Evaluation

  15. AgroTools: A Benchmark for Tool-Augmented Multimodal Agents in Agriculture

    May 21, 2026Zi Ye, Yibin Wen, Xiaoya Fan +10AI Agent BenchmarksTool-Using Vision-Language Agents

  16. Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?

    May 21, 2026Caixin Kang, Tianyu Yan, Sitong Gong +8LLM GroundingPersonality Modeling in Language Models

  17. Seizure-Semiology-Suite (S3): A Clinically Multimodal Dataset, Benchmark, and Models for Seizure Semiology Understanding

    May 21, 2026Lina Zhang, Tonmoy Monsoor, Peizheng Li +23Video UnderstandingMultimodal Large Language Models

  18. EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs

    May 19, 2026Yang Dai, Dian Jiao, Tianwei Lin +1Egocentric Video QACoT Reasoning

  19. MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems

    May 19, 2026Quanxing Xu, Yuhao Tian, Ling Zhou +4Visual Question AnsweringAutomated Software Testing

  20. HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding

    May 19, 2026Mengqi Shi, Haopeng ZhangMultimodal GroundingVideo Summarization

  21. OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding

    May 18, 2026Ruixiang Zhao, Jie Yang, Zijie Xin +4Audio-Visual UnderstandingStreaming Video Understanding

  22. Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction

    May 17, 2026Chaoqun He, Mingyang Xiang, Yingjing Xu +5Multimodal Large Language ModelsMultimodal Agents

  23. EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning

    May 17, 2026Zeyu Wang, Chang Liu, Eduardus Tjitrahardja +22Multimodal Large Language ModelsEgocentric Video Understanding

  24. PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media

    May 16, 2026Zoher Kachwala, Bao Tran Truong, Rasika Muralidharan +3Multilingual Language Model EvaluationContent Moderation

  25. GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions

    May 15, 2026Junho Kim, Xu Cao, Houze Yang +6Multimodal QAMultimodal Model Evaluation