Multimodal Model Evaluation

Latest papers 496

All topics
CardsList
  1. Cognition-Oriented Emotion Tracing from Causes to Consequences in Real-World Social Scenes

    Oct 8, 2026Hao Li, Jinye Zhang, Bobo Li +5Affective ComputingMultimodal Emotion Recognition

  2. TaoD2C-Bench: Benchmarking MLLMs for Industrial UI Code Generation Beyond Visual Fidelity

    Oct 7, 2026Chengwei Shi, Yunnong Chen, Tingting Zhou +5Code GenerationCode Generation Evaluation

  3. Open-MMUnlearning: Unifying Methods and Evaluation for MLLM Unlearning

    Oct 7, 2026Junkai Chen, Yuhao He, Qianshan Wei +19MLLM UnlearningMachine Unlearning Evaluation

  4. From Pixel to Coding: Evaluating the Figure Reproduction Capabilities of MLLMs

    Oct 7, 2026Zijian Chen, Zhengyu Chen, Bohan Liang +7Multimodal Large Language ModelsMultimodal Model Evaluation

  5. Humanity's Sixth Sense: Benchmarking Intuitive Visual Reasoning in Multimodal Models

    Oct 6, 2026Xingang Guo, Jing Gu, Brian Jang +26Visual ReasoningMultimodal Model Evaluation

  6. Beyond Perturbation Magnitude: Direction-Dependent Responses in Multimodal Geometric Representations

    Oct 6, 2026Yongsheng Luo, Wengan He, Yu Li +2Neural Representation GeometryMultimodal Robustness

  7. Visual Abstention in Unified Multimodal Models

    Oct 6, 2026Chufan Shi, Cheng Yang, Tiannuo Yang +4Unified Multimodal ModelsImage Editing

  8. Multimodal Safety Evaluation Should Measure Controllability Beyond Classification

    Oct 5, 2026Junhyeong Park, Hanwool Lee, DongGeon Lee +4Multimodal Model InterpretabilityMultimodal Model Evaluation

  9. Environmental sensor readings in two crop disease image datasets identify the session in which each image was taken

    Oct 5, 2026Sungwoo KangData LeakagePlant Disease Classification

  10. Human-Like Attention? A Psychophysical Comparison of Visual Search in Humans and MLLMs

    Oct 4, 2026Renchi Zhang, Joost C. F. de Winter, Dimitra Dodou +2Multimodal Large Language ModelsVisual Search

  11. MMPostTrainBench: Benchmarking Autonomous Research for Multimodal Post-Training

    Oct 4, 2026Yuxin Liu, Yuxuan Wang, Zhenxin Lei +9Multimodal Model EvaluationAgent Benchmarks

  12. OmniConfess: Eliciting Token Confessions to Mitigate Omni-Modal Hallucination

    Oct 2, 2026Huiqiang Rong, Haoran Luo, Hui Feng +4Multimodal Large Language ModelsMultimodal Hallucination

  13. OmniMed-Jev: Calibrating LVLM Confidence for Trustworthy Medical Multimodal Decisions via System One

    Sep 30, 2026Luyao Tang, Cheng ChenProbability CalibrationMultimodal Classification

  14. Where MLLMs Fail and Why: Causal Task Decomposition for Capability Failure Diagnosis

    Sep 30, 2026Xia Hu, Brian Potetz, Chun-Ta Lu +6LLM EvaluationCounterfactual Evaluation of VLMs

  15. ChartDensity-Bench: Benchmarking MLLMs for Numerical Data Reconstruction under Visual Density

    Sep 30, 2026Xinhe Wu, Yadong JinMultimodal RobustnessChart Data Extraction

  16. MM-FinEval: A Multi-Task Multimodal Benchmark for Real-World Financial Forecasting

    Sep 29, 2026Dong Shu, Yanguang Liu, Huopu Zhang +4Financial ForecastingMultimodal Large Language Models

  17. Does Gradient Conflict Predict the Understanding--Generation Trade-off? A Controlled Audit of Conflict-Metric Validity in Unified Multimodal Models

    Sep 29, 2026Shuyang Jiang, Fucheng Deng, Yuchuan Luo +1Unified Multimodal ModelsGradient Interference

  18. OmniVCBench: Benchmarking Evidence-Grounded Multimodal Reasoning Towards AI Virtual Cells

    Sep 29, 2026Manyu Li, Xunkai Li, Yongfu Xiong +3Visual Question AnsweringMultimodal Reasoning

  19. Evaluating the Evaluators: Diagnosing Large Multimodal Models for AI-Generated Image Assessment

    Sep 29, 2026Yu Zhao, Jiarui Wang, Huiyu Duan +5LLM-as-a-JudgeImage Generation Evaluation

  20. What Comes Next? Omni-StoryBench for Evaluating Story-Grounded Omnimodal Generation

    Sep 29, 2026Sieun Hyeon, Yejoon Lee, Mintaek Lim +3Multimodal GenerationMultimodal Model Evaluation

  21. ThinkingGuard: Decoding Implicit Hazards via Step-by-Step Risk Attribution in Multimodal Large Language Models

    Sep 29, 2026Ruochen Zhang, Yao Huang, Yitong Sun +5Multimodal ReasoningLLM Safety

  22. Reliability Testing of Medical Model Performance under Distributed Deployment

    Sep 29, 2026Yifei Wang, Xiaohan Zhang, Youtao Ding +4Multimodal Model EvaluationDistributed Inference

  23. AUV-Bench: Aesthetic Understanding and Generation Evaluation for User Interfaces

    Sep 28, 2026Zhijie Deng, Ling Li, Junhao Ji +7Multimodal Model Evaluation

  24. PhysFieldBench: Can Multimodal Models Understand Physical Fields?

    Sep 28, 2026Yuezhou Ma, Huikun Weng, Jialong Wu +5Physical ReasoningMultimodal Large Language Models

  25. ARCH-B: Architectural Representation, Comprehension and Hierarchy Benchmark

    Sep 28, 2026Kieran Sagar Parikh, Jose Luis Garcia del Castillo y LopezSemantic CorrespondenceCross-Modal Alignment

  26. SciGen-Verifier: A Multimodal Reasoner for Explainable Verification in Scientific Image Generation

    Sep 27, 2026Jiali Chen, Zhengteng Lin, Zuqi Wang +6Image Generation EvaluationScientific Reasoning in Language Models

  27. PhysAlign: A Benchmark for Evidence-Grounded Role Alignment in Multimodal Physics Reasoning

    Sep 27, 2026Kecheng Liang, Haoyang Liu, Zexin Chen +5Multimodal GroundingMultimodal Reasoning

  28. EngIntervene: Benchmarking Multimodal Engineering State Understanding and Design Intervention Reasoning

    Sep 27, 2026Jinchang Zhang, Yingda Tao, Jiakai Lin +1Multimodal GroundingMultimodal Reasoning