Multimodal Evaluation

Momentum

11 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 59

All topics
CardsList
  1. Multimodal Safety Evaluation Should Measure Controllability Beyond Classification

    Oct 5, 2026Junhyeong Park, Hanwool Lee, DongGeon Lee +4Safety BenchmarksMultimodal Evaluation

  2. PortraitAes: Intent-Conditioned Structured Portrait Aesthetics Assessment

    Oct 4, 2026Junzhou Xie, Haozhong Xiong, Xunyun Tian +8AestheticsMulti-Image Editing Benchmarks

  3. Do MLLM Judges Judge the Edit? Auditing Bias in Image Editing Evaluation with Verified Quality Preservation

    Oct 1, 2026Yuan Huang, Zirui Song, Xiuying ChenLarge Language Model JudgesMulti-Image Editing Benchmarks

  4. Multidimensional Observer Model and Perceptual Dimensions of Human Image Quality Assessment

    Sep 29, 2026Sheng Zhao, Weikai Lin, Yuhao ZhuImage Quality AssessmentMultimodal Evaluation

  5. Hierarchical Compression of Vision-Language Model Benchmarks

    Sep 29, 2026Hyunjong Ok, Seunggu Kang, Jaeho LeeVisual Token PruningMultimodal Evaluation

  6. Benchmarking Off-the-Shelf Multimodal AI Models Against Dermatologists on Patient-Captured Skin Images

    Sep 21, 2026Rian Dolphin, Laura KnowlesSkin Lesion ClassificationMultimodal Clinical Data

  7. E-AVI: Evidence-Grounded Multimodal Assessment for Automated Video Interviews

    Sep 17, 2026Haoshen Wang, Dongbo Che, Zeyi Xie +3Multimodal EvaluationFine-Grained Video Understanding

  8. Scientific Image Quality Assessment via Multi-modal Retrieval-Augmented Generation

    Sep 17, 2026Yinuo Zhang, Bingshuo Liu, Zhiying Tu +6Image Quality AssessmentMultimodal Retrieval Augmented Generation

  9. Online Multimodal Workload Assessment in Contact-Rich Physical Human-Robot Interaction

    Sep 16, 2026Yanyi Chen, Fan Yang, Min DengHuman-Robot InteractionHaptic Feedback

  10. A multimodal large language model for evidence-based autism spectrum disorder screening

    Sep 15, 2026Jun Chen, Qi Zhao, Yunliang Jiang +8Autism Spectrum DisorderScreening

  11. On-Device Language Models for Privacy-Preserving Stress Prediction: A Multimodal Evaluation on Mobile Health

    Sep 14, 2026Ibukunoluwa Soyebo, Alyssa Donawa, Rodrigo Aguilar Barrios +2Readmission PredictionStress

  12. SurgSkill-Bench: A Benchmark for Multimodal Surgical Skill Assessment

    Aug 31, 2026Chaohui Dang, Zheheng Jiang, James Glasbey +3SurgeryMultimodal Evaluation

  13. ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation

    Aug 31, 2026Samir Abdaljalil, Hunzalah Hassan Bhatti, Ahlam Bashiti +11Multimodal EvaluationCultural Awareness

  14. FitAQA: A Benchmark of Fitness Action Quality Assessment for Multimodal Large Language Models

    Aug 9, 2026Kaili Zheng, Kaiwen Wang, Xun Zhu +3AthleticismPhysical Activities

  15. Walkable to Whom? Capturing Subjective Variability in Walkability Perception Using Multimodal Deep Learning

    Aug 7, 2026Moloud Damandeh, Meead SaberiMultimodal EvaluationUrban Environments

  16. SciQNet: Two-Stage Multimodal Adaptation for Scientific Image Quality Assessment

    Aug 6, 2026Yin-Loon Khor, Yi-Jie Wong, Jing Jie Tan +1Image Quality AssessmentMultimodal Evaluation

  17. Dynamically Allocating Evaluation Effort for Model Ranking

    Aug 4, 2026Vilém Zouhar, Julia Kreutzer, Alon Lavie +4Model EvaluationEvaluation Benchmarks

  18. CALM-AH: An ABAW11-Calibrated Multimodal Ensemble with Reliability-Gated Multi-Expert Consensus for Video-Level Ambivalence and Hesitancy Recognition

    Jul 31, 2026Wenzhuo Sun, Mingjian Liang, Richard Attfield +3Affective ComputingMultimodal Evaluation

  19. SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence

    Jul 29, 2026Chuanzhi Xu, Zihan Deng, Huiqi Liang +4Scientific FigurePeer Review

  20. SpatialQ: Understanding 3D Gaussian Splatting Scene Quality via Visual-based MLLM

    Jul 29, 2026Jingxuan Su, Shenglin Wang, Tiesong Zhao +2Novel View SynthesisVideo Multimodal Large Language Models

  21. PhaseAware: Interpretable Human-in-the-Loop Rehabilitation Scoring with Boundary Monitoring

    Jul 22, 2026Yankai Zheng, Yuhe Liu, Yuxin Ma +8RehabilitationMultimodal Evaluation

  22. Style over Substance: A Shortcut Audit of Emotion-Description Preference Evaluation

    Jul 20, 2026Jiabing Yang, Yixiang Chen, Yuan Xu +6Emotion RecognitionMultimodal Evaluation

  23. Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling

    Jul 17, 2026Bo-An Chang, Yu-Chih ChenModern Text-To-Image ModelsMultimodal Evaluation

  24. Multimodal Assessment of Pancreatic Cancer Resectability Using Deep Learning

    Jul 15, 2026Vincent Ochs, Christoph Kuemmerli, Florentin Bieder +12Deep LearningMultimodal Evaluation

  25. A Calibrated Multimodal Ensemble for Ambivalence/Hesitancy Recognition: System Description and Private-Test Submission Strategy

    Jul 13, 2026Josep Cabacas-Maso, Ismael Benito-Altamirano, Carles VenturaMultimodal EvaluationEnsemble

  26. Towards Developing a Multimodal Chat Assistant for University Stakeholders: RAG-based Approach

    Jul 1, 2026Md Abu Hanif Shaikh, Abdullah Al ShafiMultimodal Retrieval Augmented GenerationChatbots

  27. PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

    Jun 26, 2026Yana Wei, Hongbo Peng, Yanlin Lai +14Multimodal EvaluationPerception

  28. Cross-view Multimodal Vision-Based Assessment Framework for Traditional Chinese Medicine Rehabilitation Training

    Jun 26, 2026Francis Xiatian Zhang, Hao Yao, Shengxuan Chen +4Multimodal EvaluationCross-View

  29. TraMP-LLaMA: Generative Interpretability with Decoupled Instruction Tuning for Facial Expression Quality Assessment

    Jun 25, 2026Shuchao Duan, Alan Whone, Hossein Rahmani +2Facial Expression RecognitionMultimodal Evaluation

  30. Evaluation Pitfalls and Challenges in Multimedia Event Extraction

    Jun 25, 2026Philipp Seeberger, Steffen Freisinger, Tobias Bocklet +1Multimodal EvaluationChallenges

  31. When AUC 0.998 Is Not Enough: A Candidate Evaluation Protocol for Hidden-State Probes of Indirect Prompt Injection in Multimodal Computer-Use Agents

    Jun 22, 2026Yanhang Li, Zhichao Fan, Zexin ZhuangIndirect Prompt InjectionMultimodal Evaluation

  32. Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images

    Jun 16, 2026Yunzhe Xue, Mohammed Saim Ahmed Quadri, Neal Panse +2Medical Vision-Language ModelsMultimodal Clinical Data

  33. Structured Visual Evidence Decomposition for Evidence-Grounded Multimodal Screening of Obstructive Sleep Apnea-Hypopnea Syndrome

    May 23, 2026Chen Zhan, Yingchen Wei, Xiaoyu Tan +2ScreeningMultimodal Clinical Data

  34. QwenSafe: Multimodal Content Rating Description Identification via Preference-Aligned VLMs

    May 20, 2026Dishanika Denipitiyage, Aruna Seneviratne, Suranga SeneviratneMultimodal EvaluationContent Moderation

  35. Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking

    May 13, 2026Qinwu Xu, Zhuoheng Li, Jessie SalasMultimodal EvaluationLarge Language Model Evaluation

  36. Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity

    May 12, 2026Abid Ali, Diego Molla-Aliod, Usman NaseemMultimodal EvaluationSummarization

  37. MLCR: Multi-Level Cue Refinement for Long-Term Multimodal Action Quality Assessment

    May 9, 2026Qiqi Li, Pengfei Wang, Hongyu Chen +1Multimodal EvaluationSpatial Encoding

  38. Erase Persona, Forget Lore: Benchmarking Multimodal Copyright Unlearning in Large Vision Language Models

    May 5, 2026JuneHyoung Kwon, JungMin Yun, YoungBin KimUnlearning MethodMultimodal Evaluation

  39. MultiSense-Pneumo: A Multimodal Learning Framework for Pneumonia Screening in Resource-Constrained Settings

    May 4, 2026Dineth Jayakody, Pasindu Thenahandi, Chameli DommanigeMultimodal Clinical DataLung-Nodule Artificial Intelligence

  40. When Jokes Cross the Line: Analyzing Regular Humor and Dark Humor in YouTube Shorts

    Apr 30, 2026Sydney Johns, Sanjeev Parthasarathy, Shantnu Bhalla +1HumorShort Video Bursts

  41. HotComment: A Benchmark for Evaluating Popularity of Online Comments

    Apr 28, 2026Yafeng Wu, Yunyao Zhang, Liliang Ye +4Social Media Timeline DynamicsContent Moderation

  42. VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation

    Apr 28, 2026Divake Kumar, Sina Tayebati, Devashri Naik +2Multimodal EvaluationLarge Language Model Judges

  43. QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering

    Apr 27, 2026Woojun Jung, Junyeong KimSummarizationMultimodal Evaluation

  44. FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment

    Apr 26, 2026Sophie Chiang, Tom Brennan, Fethiye Irmak Dogan +2Medical Vision-Language ModelsMultimodal Clinical Data

  45. WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models

    Apr 20, 2026Xinping Lei, Xinyu Che, Junqi Xiong +16Multimodal EvaluationEvaluation Benchmarks

  46. SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents

    Mar 31, 2026Kuangshi Ai, Haichao Miao, Kaiyuan Tang +13MemoryagentbenchEvaluation Benchmarks

  47. Toward Scalable Audio Description Quality Control: A Workflow for Evaluating Human and VLM Raters

    Feb 1, 2026Lana Do, Gio Jung, Juvenal Francisco Barajas +5Video QualityMultimodal Evaluation

  48. From Global to Granular: Revealing IQA Model Performance via Correlation Surface

    Jan 29, 2026Baoliang Chen, Danni Huang, Hanwei Zhu +5Image Quality AssessmentSpearman Correlation

  49. Redemption Score: A Multi-Modal Evaluation Framework for Image Captioning via Distributional, Perceptual, and Linguistic Signal Triangulation

    May 22, 2025Ashim Dahal, Ankit Ghimire, Saydul Akbar Murad +1Multimodal EvaluationImage Difference Captioning

  50. CatSIM: A Categorical Image Similarity Metric

    Apr 20, 2020Geoffrey Z. Thompson, Ranjan MaitraImage Quality AssessmentSimilarity and Metrics