Multimodal Understanding

Momentum

10 papers in the last four weeks, up 233% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 413

All topics
CardsList
  1. M3^3Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks

    Jun 3, 2026Jie Huang, Ruixun Liu, Sirui Sun +4Multimodal MemoryMultimodal Model Evaluation

  2. A Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs

    Jun 3, 2026Huangchen Xu, Yuan Wu, Yi ChangMultimodal Large Language ModelsMultimodal Model Evaluation

  3. VCIFBench: Evaluating Complex Instruction Following for Video Understanding

    Jun 3, 2026Huangchen Xu, Yuan Wu, Yi ChangVLM EvaluationVideo Understanding

  4. Hyper-ICL: Attention Calibration with Hyperbolic Anchor Distillation for Multimodal In-Context Learning

    Jun 3, 2026Niloufar Alipour Talemi, Hossein Kashiani, Fatemeh AfghahEfficient Multimodal InferenceMultimodal ICL

  5. Overview of the EReL@MIR 2025 Multimodal Document Retrieval Challenge (Track 1)

    Jun 2, 2026Jingbiao MeiMultimodal IRMultimodal Embedding

  6. Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models

    Jun 2, 2026Mahtab Bigverdi, Linjie Li, Weikai Huang +8Visual Spatial ReasoningVisual Reasoning

  7. GridVQA-X: A Framework for Evaluating Multimodal Explainability Methods

    Jun 2, 2026Sujay Belsare, Sudarshan Nikhil, Sushant Kumar +2Multimodal ReasoningMultimodal Model Interpretability

  8. Benchmarking Visual State Tracking in Multimodal Video Understanding

    Jun 2, 2026Sihyun Yu, Nanye Ma, Pinzhi Huang +8Multimodal Large Language ModelsVideo Reasoning

  9. OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs

    Jun 2, 2026Yifei Li, Pengyiang Liu, Yuhang Zang +4Spatial Reasoning BenchmarksSpatiotemporal Reasoning

  10. Beyond the Literal: Decomposing Pragmatic Intent in Multimodal Meme Understanding

    Jun 2, 2026Zhengyi Zhao, Shubo Zhang, Zezhong Wang +6Multimodal Disentangled Representation LearningRepresentation Disentanglement

  11. MUSE: A Unified Agentic Harness for MLLMs

    Jun 2, 2026Jianglin Lu, Hailing Wang, Xu Ma +4Multimodal ReasoningMultimodal Agents

  12. Spectral-Progressive Thought Flow for Lightweight Multimodal Reasoning

    Jun 1, 2026Yixian Shen, Zhiheng Yang, Qi Bi +6Efficient Multimodal InferenceVisual Spatial Reasoning

  13. AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

    Jun 1, 2026Yaoting Wang, Ziyi Zhang, Wenming Tu +10Audio-Visual UnderstandingMultimodal Robustness

  14. AdaCodec: A Predictive Visual Code for Video MLLMs

    Jun 1, 2026Haowen Hou, Zhen Huang, Zheming Liang +8Predictive CodingEfficient VLM Inference

  15. Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains

    Jun 1, 2026Garvin Guo, Donglei Yu, Yu Chen +6Tool-Use EvaluationLLM Agent Evaluation

  16. Before Fusion, Ask What to Keep: Contextual Calibration of Multimodal Signals

    Jun 1, 2026Jiyuan Liu, Liangwei Nathan Zheng, Wei Emma Zhang +2Multimodal RobustnessMultimodal Fusion

  17. Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning

    May 31, 2026Garvin Guo, Yu Chen, Xiang Wang +4VLM EvaluationVLM Interpretability

  18. Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

    May 31, 2026Wanlong Fang, Tianle Zhang, Wen Tao +1Multimodal GroundingMultimodal Large Language Models

  19. Sandboxed Coding Agents are Competitive Omni-modal Task Solvers

    May 30, 2026Dongping Chen, Xuanao Huang, Zhihan Hu +3Audio-Visual UnderstandingAI Coding Agents

  20. Recognizing Co-Speech Gestures in-the-Wild

    May 29, 2026Sindhu B Hegde, K R Prajwal, Andrew ZissermanMultimodal GroundingGesture Recognition

  21. When Are Multimodal Predictions Biologically Supported? A Diagnostic Evaluation Framework

    May 29, 2026Dylan Steiner, Gustavo Arango-Argoty, Gerald Sun +1Pathology Foundation ModelsMultimodal Embedding

  22. VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning

    May 29, 2026Hengbo Xu, Shengjie Jin, Yanbiao Ma +1Efficient Multimodal InferenceVisual Attention