Multimodal Benchmarks

Latest papers 166

All topics
CardsList
  1. MMPostTrainBench: Benchmarking Autonomous Research for Multimodal Post-Training

    Oct 4, 2026Yuxin Liu, Yuxuan Wang, Zhenxin Lei +9Multimodal Benchmarks

  2. EviRover: Reinforcing Agentic Perception Beyond a Glance

    Sep 30, 2026Kaixuan Fan, Kaituo Feng, Tianshuo Peng +4Visual PerceptionPerception

  3. MM-FinEval: A Multi-Task Multimodal Benchmark for Real-World Financial Forecasting

    Sep 29, 2026Dong Shu, Yanguang Liu, Huopu Zhang +4Multimodal Benchmarks

  4. What Comes Next? Omni-StoryBench for Evaluating Story-Grounded Omnimodal Generation

    Sep 29, 2026Sieun Hyeon, Yejoon Lee, Mintaek Lim +3Omni-ModalMultimodal Generation

  5. Beyond Binary Preferences: Graded Preference Optimization for Limb-Motion Captioning

    Sep 29, 2026Yanan Wang, Tingsong Li, Kaixun Jiang +3Video CaptioningOpen-Vocabulary Action Recognition

  6. ARCH-B: Architectural Representation, Comprehension and Hierarchy Benchmark

    Sep 28, 2026Kieran Sagar Parikh, Jose Luis Garcia del Castillo y LopezMultimodal BenchmarksBuilding Information Modeling

  7. EngIntervene: Benchmarking Multimodal Engineering State Understanding and Design Intervention Reasoning

    Sep 27, 2026Jinchang Zhang, Yingda Tao, Jiakai Lin +1EngineeringMultimodal Benchmarks

  8. BAS-OPD: Budget-Aware Selective On-Policy Self-Distillation for Fine-Grained Multimodal Perception

    Sep 22, 2026Zihan Chen, Hengguang Zhou, Yuan Kang +5Unsupervised On-Policy Self-DistillationRecent Vision-Language Models

  9. TAC-Time: Texts as Channels For Multimodal Time Series Forecasting

    Sep 21, 2026Jiayi Liang, Xiaotian Gu, Xinyu Xie +2Multivariate Time Series ForecastingTemporal Dynamics

  10. MiX: Micro-Inverted-Scaling for End-to-End Low-Bit Vision-Language Model Acceleration

    Sep 17, 2026Yuan Liao, Jae-sun SeoGradient QuantizationMix

  11. MUSE: Benchmarking Large Vision-Language Models on Multi-Modal Understanding in Situated Education

    Sep 16, 2026Luyao Zhu, Xun Wei Yee, Wei Li +2Multimodal BenchmarksMultimodal Understanding

  12. Urban Boundaries, Social Barriers: A Benchmark and Vision-Centric Framework for Mapping Gated Communities and Equity Implications

    Sep 3, 2026Minwei Zhao, Weiming Zhang, Jiawang Du +4Urban EnvironmentsDelineation

  13. Do VLMs Share Safety Neurons Across Modalities?

    Aug 31, 2026Jiaxuan Li, Jiahao Zhang, Duc Minh Vo +3Multimodal BenchmarksNeurons

  14. Read the Room, Read the Image: Understanding Indirect Speech Acts in Multimodal Visual Contexts

    Aug 31, 2026Jaehee Kim, Ji Hoon Chung, Seoyoon Park +5Multimodal BenchmarksDialogue Benchmarks

  15. When History Is Multimodal: Rethinking Context Management for Long-Horizon Agents

    Aug 30, 2026Jiaqi Su, Cong Pang, Jiawei Hong +4Multimodal MemoryLong-Horizon Agents

  16. MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models

    Aug 27, 2026Ashshak Sharifdeen, Shihab Aaqil Ahamed, Ufaq Khan +6Medical Vision-Language ModelsMultimodal Benchmarks

  17. Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

    Aug 12, 2026Weihao Bo, Shan Zhang, Yanpeng Sun +7DiagramsDiagnostic Benchmark

  18. MBA: Multimodal Benchmark and Agents for Real-World Business Ideation

    Aug 12, 2026Hojun Choi, Jaeyo Shin, Suin Lee +1Multimodal AgentsMultimodal Benchmarks

  19. Rethinking Text-Based Image Retrieval in Specific Domain

    Aug 11, 2026Jingyang Tan, Sheng Yang, Yuanpeng Chen +4Multimodal RetrievalFine-Grained Perception

  20. Hyperbolic Multimodal Continual Learning

    Aug 10, 2026Jiahong Liu, Ming Shen, Xiaohao Liu +4Hyperbolic LearningReplay-Based Continual Learning

  21. Jako Tako or Fluent? Presenting PoVisLE: A Polish Vision-Language Evaluation

    Aug 7, 2026Anna Kołos, Grzegorz Statkiewicz, Karolina Seweryn +3Multilingual BenchmarkMultimodal Benchmarks

  22. An AI4AI Framework for Visual Token Pruning

    Aug 7, 2026Zhen Liu, Wenli Huang, Wei Song +3Visual Token PruningMultimodal Benchmarks

  23. OmniMech: All-in-one Multimodal Mechanical Benchmark for 3D Reconstruction

    Aug 6, 2026Taiting Lu, Runze Liu, Ziwei Dong +18Large-Scale Benchmark3D Reconstruction

  24. OmniRouting: A Semantic-Coupled Multimodal Benchmark for Constraint-Aware Spatial Reasoning in PCB Routing

    Aug 5, 2026Taiting Lu, Kaiyuan Lin, Ziwei Dong +18Electronic Design AutomationLarge Language Model Routing

  25. BanglaWild: An In-the-Wild Bengali Scene Text Recognition Benchmark for OCR and Vision-Language Models

    Aug 4, 2026Sadab Shiper, Tawsif Tashwar Dipto, Mir Md Inzamam +1Optical Character RecognitionScene Text Recognition

  26. Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

    Aug 2, 2026Jianmin Chen, Jiaqi Tang, Wei Wei +9Latent Visual ReasoningVisual Memory

  27. Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models

    Aug 2, 2026Leyan Xue, Feng Xiong, Mingjun Ma +1Token-Level UncertaintyMultimodal Benchmarks

  28. PathView-Bench: Can Multimodal Large Language Models Achieve Fine-grained Multiscale Understanding of Pathology Images?

    Jul 30, 2026Zongyi Chen, Yu Liang, Jie Lin +1Multimodal BenchmarksMultimodal Clinical Data

  29. MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos

    Jul 30, 2026Jinpeng Hu, Erqiang Wang, Shan Wang +4Video Multimodal Large Language ModelsMental Health

  30. AHA-Memes: A Fine-Grained Multimodal Benchmark for Understanding Hate in Arabic Memes

    Jul 29, 2026Mohamed Bayan Kmainasi, Ali Ezzat Shahroor, Abul Hasnat +3MemesHate Speech

  31. Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification

    Jul 27, 2026Francisco Mena, Dino Ienco, Roberto Interdonato +2Missing ModalitiesMultimodal Classification

  32. MulRobBench: A Decision-Level Benchmark for Safe and Security-Policy-Compliant Multimodal UAV Agents

    Jul 26, 2026Belal S. Alsinglawi, Weizheng Wang, Junyi Wu +3Multi-UavUnmanned Aerial Vehicles

  33. ObsDriveBench: Benchmarking Multimodal Understanding under Adverse Weather with Observability Awareness

    Jul 26, 2026Qiao Yan, Yihan Wang, Zhenghao Xing +2Autonomous DrivingMultimodal Benchmarks

  34. Twins: Learn to Predict Unified Representations with Focal Loss

    Jul 24, 2026Kaixiong Gong, Xin Cai, Bin Lin +9Conditional Variational AutoencoderUnified Representation

  35. RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding

    Jul 24, 2026Jianqin Liu, Weiwei Cao, Wanxing Chang +7Medical ImagesMultimodal Clinical Data

  36. Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms

    Jul 23, 2026Abu Tyeb Azad, Fahim Ahmed, Ishita Sur Apan +7DocumentBangla

  37. Can Multimodal Large Language Models Understand OCT?

    Jul 18, 2026Baochen Fu, Wenzhi Deng, Baihao Jin +5Optical Coherence TomographyMultimodal Benchmarks

  38. VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

    Jul 16, 2026Yunfeng Liu, Yuandong Yang, Jiarui Han +5Assistive AgentsMultimodal Benchmarks

  39. MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation

    Jul 10, 2026Runhan Shi, Quan Zhou, Yuqian Xu +14Multimodal Clinical DataMultimodal Benchmarks

  40. UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

    Jul 9, 2026Haibin Tian, Huichao Xie, Xuelin Qian +3Aerial ImageryVisual Grounding Benchmarks

  41. Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks

    Jul 8, 2026Ethan Chung, Chuanjun Zheng, Jasper Tan +3Multi-Image Editing BenchmarksMultimodal Benchmarks

  42. Music I Care About: Automated Multimodal Benchmarking of LLM Music Perception Skills on (Almost) Any Music

    Jul 7, 2026Tomáš Sourada, Katia Vendrame, Jan HajičMultimodal Benchmarks

  43. Evaluating and Understanding Model Editing for Medical Vision Language Models

    Jul 6, 2026Guli Zhu, Chenwei Wu, Liyue ShenMedical Vision-Language ModelsMultimodal Benchmarks

  44. OmniLayout: A Schematic-Coupled Multimodal Benchmark for Constraint-Aware Geometric Reasoning in PCB Layout

    Jul 3, 2026Taiting Lu, Kaiyuan Lin, Mingjia Wang +12Printed Circuit BoardLayouts

  45. MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

    Jul 2, 2026Yuanzhi Liu, Shousheng Zhao, Bo Zhou +2Multimodal BenchmarksEvaluation Benchmarks

  46. MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs

    Jun 30, 2026Zhongyang Li, Yaqian Li, Faming Fang +6Multimodal Large Language ModelsRecent Vision-Language Models