Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. KhatianDoc: A Human-Verified Benchmark Diagnosing Multimodal LLM Failure on Bengali Legal Land Records

    Sep 3, 2026Tasmiad Hasan, Arafat Zaman Ratul, Sarker Sadman Saalim +3Legal Document AnalysisLegal QA

  2. CulturalMenuBench: Probing the Knowledge-Application Gap in Multimodal Culinary Reasoning

    Sep 3, 2026Bo Zeng, Linfeng Gao, Peiqin Lin +9Multimodal ReasoningMultilingual VLM Evaluation

  3. MedQA-MM: Shortcuts Behind Medical Visual Reasoning

    Sep 3, 2026Benlu Wang, Yifan Zhang, Jiaqing Yu +7Medical VQAShortcut Learning

  4. Deeply Interleaved Text-Image Contexts for Multimodal LLMs Assessment

    Sep 2, 2026Zihao Wang, Xi Xiang, Yuwen Sun +5Vision-Language ModelsMultimodal Model Evaluation

  5. DocHop: Benchmarking Out-of-domain Multi-hop Reasoning in Information-Dense Documents

    Sep 2, 2026Zhuoran Yu, Le Thien Phuc Nguyen, Jaden Park +5Multimodal Large Language ModelsChart QA

  6. Does Playing it Safe Count as Faithfulness? Reassessing LVLM Hallucination Mitigation Methods

    Sep 1, 2026Mehrdad Fazli, Sina Mansouri, Mohit Marvania +1VLM EvaluationFaithfulness in VLMs

  7. ExBind: A Controlled Diagnostic Benchmark for Visual-to-Executable Correspondence

    Sep 1, 2026Ziqian Wang, Yuxiao Cheng, Tingxiong Xiao +1Multimodal GroundingMultimodal Model Evaluation

  8. A Composable Evaluation System for Reproducible Omni-Modal Foundation Model Evaluation

    Sep 1, 2026Hodong Lee, Sanghee Park, Dohoon Ryu +4ML ReproducibilityMultimodal Foundation Models

  9. SciTrue: Reliable Scientific Claim Validation with Frontier and Open Language Models at the NTCIR SciClaimEval Task

    Sep 1, 2026Qiming Bao, Neşet Özkan Tan, Siyuan Wang +1Document UnderstandingLLM Evaluation

  10. Distributed Implicit Harm: A Compositional Safety Blind Spot in MLLM-Based Video Moderation

    Aug 31, 2026Ruotong Wang, Zihao Zhu, Siwei Lyu +2Multimodal Large Language ModelsVideo Content Moderation

  11. MMDS-Bench: Benchmarking Multimodal Large Language Models on Dynamic Stance in Social Media Interactions

    Aug 31, 2026Yuzhe Ding, Kang He, Li Zheng +5Multimodal Large Language ModelsMultimodal Reasoning

  12. SurgSkill-Bench: A Benchmark for Multimodal Surgical Skill Assessment

    Aug 31, 2026Chaohui Dang, Zheheng Jiang, James Glasbey +3Surgical Video UnderstandingMultimodal Model Evaluation

  13. OCR-MetaReasoning Benchmark: Evaluating the Meta-Reasoning Ability of MLLMs in Text-Rich Image Understanding

    Aug 31, 2026Gengxu Li, Yuan Wu, Yi ChangVisual ReasoningMultimodal Reasoning

  14. Fine-Grained Multi Image Object Hallucination Benchmark

    Aug 31, 2026Joonki Min, Chaeyun Kim, Hyungwook Choi +4VLM EvaluationObject Hallucination in VLMs

  15. ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation

    Aug 31, 2026Samir Abdaljalil, Hunzalah Hassan Bhatti, Ahlam Bashiti +11Hallucination DetectionT2I Generation

  16. Foundation and Multimodal Large Language Models for Face Presentation and Morph Attack Detection

    Aug 30, 2026Hatef Otroshi Shahreza, Asif Hussain Khan, Peter Lorenz +2Image Forgery DetectionVision Foundation Model Adaptation

  17. DVBench: Benchmarking MLLMs for Understanding Dynamic Charts and Narratives in Data Videos

    Aug 30, 2026Bomiao Wang, Zekai Shao, Jiexiang Lan +3Video UnderstandingVideo-Language Model Evaluation

  18. Modality Fault Lines: Structural Corruptions Reveal Fragile Omni-Modal Reasoning

    Aug 29, 2026Zhaolu Kang, Meixin Wu, Yu Xue +6Multimodal RobustnessMultimodal Large Language Models

  19. WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents

    Aug 28, 2026Zongkai Liu, Hui Zhang, Liqiang Niu +7Multimodal IRMultimodal Search Agents

  20. Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

    Aug 13, 2026Xinming Wang, Weinong Wang, Hongming Yang +13RL for Language ModelsLLM Alignment

  21. Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

    Aug 12, 2026Weihao Bo, Shan Zhang, Yanpeng Sun +7Code GenerationMultimodal QA

  22. Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models

    Aug 12, 2026Hao Zhang, Jiaxin Qi, Zhijiang Tang +1Unified Multimodal ModelsMultimodal Reasoning

  23. Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System

    Aug 12, 2026Haoyu Zhang, Shuoxun Zhang, Peng Ye +5Visual Question AnsweringMulti-Agent LLM Systems

  24. MBA: Multimodal Benchmark and Agents for Real-World Business Ideation

    Aug 12, 2026Hojun Choi, Jaeyo Shin, Suin Lee +1AI Agent BenchmarksComputational Creativity

  25. PRMU: A Corpus-Free Benchmark for Person-Centric Knowledge Unlearning in Multimodal Large Language Models

    Aug 11, 2026Huafeng Chen, Yueming Lyu, Ziyuan Chen +4MLLM UnlearningMachine Unlearning

  26. Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

    Aug 11, 2026Zhaoyang Wei, Bowen Jiang, Xumeng Han +6Multimodal GroundingMultimodal Robustness

  27. CircuitReason-1k: Benchmarking Long-Horizon Visual-to-Symbolic Reasoning inElectrical Circuits

    Aug 10, 2026Xinqi Yang, Kang An, Tengyue Wang +8Structured ReasoningVisually Grounded Reasoning

  28. MMArch: Benchmarking Multimodal Reasoning Grounded in Architectural Evidence

    Aug 10, 2026Chenxu Du, Kang An, Tengyue Wang +8Multimodal ReasoningVisually Grounded Reasoning