Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. AnesTRACE: Benchmarking Intraoperative Anesthesia from Multimodal Perception to Multi-step Decision-Making

    Sep 26, 2026Ziwei Huang, Qi Gao, Zhe Ji +5HealthcareClinical Decision Support

  2. LAYERSCOPE: A Layerwise Characterization of Video and Multimodal Learned Representations

    Sep 23, 2026Sandra Arcos-Holzinger, Debashish Chakraborty, Rohita Mocharla +7Representation GeometryRepresentation Learning

  3. Benchmarking Off-the-Shelf Multimodal AI Models Against Dermatologists on Patient-Captured Skin Images

    Sep 21, 2026Rian Dolphin, Laura KnowlesSkin Lesion ClassificationMedical VLMs

  4. Omni2Web: Benchmarking Audiovisual Website Development

    Sep 20, 2026Minghao Han, Zhenghao Xing, Xize Cheng +7Multimodal GroundingAudio-Visual Understanding

  5. AVTrace: Diagnosing Audio-Visual Temporal Reasoning in Omni Models

    Sep 17, 2026Longyin Zhang, Parth Sakhare Mahendra, Chengwei Wei +4Temporal Video GroundingAudio-Visual Understanding

  6. A Unified Evaluation Framework for Trustworthy Large Language Models, Agentic AI, and Multimodal Systems

    Sep 17, 2026Shaina Raza, Ahmed Y. Radwan, Imran Liaquat +1LLM EvaluationAI Agent Evaluation

  7. MUSE: Benchmarking Large Vision-Language Models on Multi-Modal Understanding in Situated Education

    Sep 16, 2026Luyao Zhu, Xun Wei Yee, Wei Li +2VLM EvaluationLarge Vision-Language Models

  8. Rethinking Domain Specialization for Open-Ended Scientific Reasoning in Astronomy Language Models

    Sep 15, 2026Vanessa Lama, Sanjay Das, Emily Herron +5LLM EvaluationScientific QA

  9. TwinICL: Diagnosing Multimodal In-Context Learning through Paired Counterfactuals

    Sep 14, 2026Zihan Xue, Po-Yi Lu, Serhii Honcharenko +5Multimodal ICLModality Gap in VLMs

  10. On-Device Language Models for Privacy-Preserving Stress Prediction: A Multimodal Evaluation on Mobile Health

    Sep 14, 2026Ibukunoluwa Soyebo, Alyssa Donawa, Rodrigo Aguilar Barrios +2On-Device Language Model InferencePrivacy-Preserving Language Models

  11. Physics as the label for measuring and correcting materials reasoning in multimodal models

    Sep 14, 2026Hasan Kurban, Rasul Khanbayov, Mustafa KurbanMultimodal ReasoningMultimodal Model Evaluation

  12. LatentVerse: A Framework for Understanding Shared and Modality-Specific Information in Multimodal Latent Representations

    Sep 14, 2026Majd Alafrange, Samuel Friedman, John Kitonyo +2Multimodal EmbeddingMultimodal Model Interpretability

  13. Calibrated Ambiguity in Multimodal Language Models: Humans reach for cultural references, while models describe the picture

    Sep 14, 2026Cody Kommers, Mingrui Ye, Evelyn Gius +4Pragmatic Reasoning in Language ModelsMultimodal Large Language Models

  14. Anchoring Clinical Events in Time: UID-Preserving Multimodal Reconstruction and Source-Grounded Adjudication

    Sep 14, 2026Sayantan Kumar, Nicolas Grimaldi, Jack Cummins +1Multimodal GroundingDocument Information Extraction

  15. Beyond Generation and Accuracy: Diagnosing and Enhancing Visual Chain-of-Thought for Geometry Problem Solving

    Sep 11, 2026Zhitong Dong, Jicai Pan, Yingguo Gao +3Mathematical ReasoningMultimodal CoT Reasoning

  16. OmniHallu: Unified Hallucination Detection for Cross-Modal Comprehension and Generation in Multimodal Large Language Models

    Sep 11, 2026Jianjiang Yang, Peihang Li, Shanqing Xu +3Hallucination Detection in VLMsHallucination Detection

  17. The Illusion of Balanced Multimodal Sentiment Analysis: Beyond the Limits of Optimization-Based Methods

    Sep 11, 2026Ioanna Kaffeza, Efthymios Georgiou, Alexandros PotamianosModality ImbalanceMultimodal Optimization

  18. ReGround: Grounding Reviewer Comments in Multimodal Evidence

    Sep 11, 2026Serwar Basch, Lizhen Qu, Iryna GurevychMultimodal IRScholarly Peer Review

  19. Studying Image Tokenizers as Visual Languages in Unified Multimodal Models

    Sep 8, 2026Siting Li, Zhengyang Wang, Simon Shaolei Du +2Image TokenizationUnified Multimodal Models

  20. SAFIRE: Safety-Critical Benchmark for Fine-grained Fire and Smoke Understanding in Multimodal LLMs

    Sep 7, 2026Pengfei Li, Naufal Suryanto, Sicheng Zhang +2LLM Safety BenchmarksLLM Safety Evaluation

  21. Where Should Language Sit in a Multimodal Model? Lessons from What Language Does to Human Perception and Cognition

    Sep 7, 2026Peng Xie, Amr AlanwarUnified Multimodal ModelsMultimodal Fusion

  22. Whose record is this? Diagnosing and authorizing record use in personalized multimodal models

    Sep 7, 2026Xinyu Mao, Junsi Li, Chenyang Liu +2Memory-Augmented VLMsMultimodal Model Evaluation

  23. MM-IFEval-Pro: A Multilingual and Attack-Resistant Benchmark for Instruction-Following in Vision-Language Models

    Sep 4, 2026Changming Xiao, Zhenliang Ni, Jinhui He +2VLM RobustnessAdversarial Attacks on VLMs

  24. InSituMeasure: Probing Situated Measurement Grounding in Industrial Scenes with Multimodal Large Language Models

    Sep 3, 2026Chao Shen, Xinyuan Li, Yunfan Zhou +4Multimodal GroundingMultimodal Robustness