Multimodal Understanding

Momentum

10 papers in the last four weeks, up 233% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 413

All topics
CardsList
  1. Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence

    May 29, 2026Yuhan Wang, Shuochen Chang, Yalin Feng +8Multi-Agent CollaborationVLM Reasoning

  2. Your Multimodal Speech Model Says I Have a Face for Radio

    May 28, 2026Maya K. Nachesa, Vlad Niculae, Vagrant GautamASR EvaluationDemographic Bias in ASR

  3. Grounded 3D-Aware Spatial Vision-Language Modeling

    May 28, 2026An-Chieh Cheng, Yang Fu, Yatai Ji +123D Spatial ReasoningVisually Grounded Reasoning

  4. MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization

    May 28, 2026Anisha Saha, Varsha Suresh, Teodora Kamova +3VLM RobustnessMultimodal Reasoning

  5. OVA-IB: One vs All Information Bottleneck for Multi-Modal Alignment

    May 28, 2026Tianchao Li, Shujian Yu, Xinrui Zu +4Cross-Modal LearningCross-Modal Alignment

  6. MIRAGE: Adaptive Multimodal Gating for Whole-Brain fMRI Encoding

    May 28, 2026Abdulkadir Gokce, Badr AlKhamissi, Martin SchrimpfNeuroimagingNeural Encoding

  7. MMTM: Tri-Modal Topic Modeling for Long-Form Video via Similarity-Gated Fusion

    May 28, 2026Ali Abusaleh, Bhuvanesh Verma, Alexander MehlerTopic ModelingLong-Video Understanding

  8. TRACER: Persistent Regularization for Robust Multimodal Finetuning

    May 28, 2026Hesam Asadollahzadeh, Feng Liu, Christopher Leckie +1VLM RobustnessNeural Network Robustness

  9. DMC-CF: Dynamic Multimodal CounterFactual QA benchmark for Causal Reasoning

    May 28, 2026Junzhe Zhang, Huixuan Zhang, Guirong Wang +5Counterfactual EvaluationCounterfactual Reasoning in Language Models

  10. Persona Prompting in Multimodal Urban Perception: Descriptive Convergence and Interpretive Variation

    May 27, 2026Neemias da Silva, Matt Ratto, Myriam Delgado +3Multimodal Large Language ModelsLanguage Model Bias Evaluation

  11. Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning

    May 27, 2026Yang Zhang, Xiaoshuai Sun, Rui Zhao +5Active PerceptionMultimodal Reasoning

  12. Towards Unified Vision-Language Models with Incomplete Multi-Modal Inputs

    May 27, 2026Xiang Fang, Wanlong Fang, Changshuo Wang +4Missing-Modality LearningVLM Robustness

  13. How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning

    May 26, 2026Qian Yang, Ankur Sikarwar, Huy Le +4Visual Spatial ReasoningUnified Multimodal Models

  14. Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

    May 26, 2026Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao +9Vision-Language ModelsVLM Interpretability

  15. O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding

    May 26, 2026Peiran Wu, Yunze Liu, Chi-Hao Wu +2Audio-Visual UnderstandingEfficient Multimodal Inference

  16. Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

    May 25, 2026Bonan Ding, Umair Nawaz, Ufaq Khan +5Cross-Modal LearningMultimodal Large Language Models

  17. Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning

    May 25, 2026Longteng Guo, Yifan Wang, Pengkang Huo +4Visual ReasoningVLM Reasoning

  18. Toward Native Multimodal Modeling: A Roadmap

    May 25, 2026Siyu An, Junru Lu, Junnan Dong +18Unified Multimodal ModelsMultimodal Generation

  19. DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement

    May 25, 2026Renjie Lu, Xulong Zhang, Xiaoyang Qu +2Multimodal Disentangled Representation LearningUnified Multimodal Models

  20. AOEPT: Breaking the Implicit Modality-Reduction Bottleneck in Modality-Missing Prompt Tuning

    May 24, 2026Jian Lang, Rongpei Hong, Ting Zhong +1Missing-Modality LearningMultimodal Reasoning

  21. OmniEgo-R2^2: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

    May 23, 2026Zixu Li, Zhiwei Chen, Zhiheng Fu +4Egocentric Video QAEgocentric Video Understanding