Multimodal Understanding

Momentum

10 papers in the last four weeks, up 233% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 413

All topics
CardsList
  1. Gestalt: Large Multimodal Interplay Model

    Sep 30, 2026Zequn Yang, Yu Miao, Haotian Ni +8Unified Multimodal ModelsCross-Modal Alignment

  2. Beyond Layers: Position-Resolved Gradient Conflict and Position-Aware Modulation for Unified Multimodal Models

    Sep 29, 2026Shuyang Jiang, Fucheng Deng, Yuchuan Luo +1Unified Multimodal ModelsGradient Interference

  3. Mutually Adversarial Self-Training with Evolving Data for Unified Multimodal Models

    Sep 28, 2026Wentao Zhou, Weijie Gan, Jiayun WangAdversarial TrainingUnified Multimodal Models

  4. Efficient Unified Multimodal Understanding (EUMU): Winning Solution for the MUMU Track at the 8th LSVOS Challenge

    Sep 16, 2026Dayoung Kil, Seong-heum KimOpen-Vocabulary Object DetectionEfficient Multimodal Inference

  5. Negation Beyond the Verbal Channel: Temporal Multimodal Correlates in Dialogue

    Sep 14, 2026Leon Hammerla, Patrick Schrottenbacher, Alexander MehlerMultimodal Understanding

  6. MultiHuSE: A Multimodal Dataset for Humour Styles and Emotions

    Sep 11, 2026Mary Ogbuka Kenneth, Foaad Khosmood, Abbas EdalatText ClassificationMultimodal Understanding

  7. DYAD: A Multimodal Dataset of Co-Located Human Assistance

    Sep 8, 2026Akhil Ajikumar, Mahya Qorbani, Sakib Reza +2Human-AI InteractionAssistive Robotics

  8. BanglaMemeX: Advancing Cultural Metaphoric Image Interpretation in Bangla with a Multimodal Explainable Dataset

    Sep 7, 2026Md. Sadman Sakib, Zisan Mahmud, Md. Fahim Arefin +1Figurative Language UnderstandingMultilingual VLM Evaluation

  9. Uncovering Understanding-Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System

    Sep 1, 2026Penghao Wu, Haiwen Diao, Weichen Fan +3Unified Multimodal ModelsMultimodal Generation

  10. Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models

    Aug 12, 2026Hao Zhang, Jiaxin Qi, Zhijiang Tang +1Unified Multimodal ModelsMultimodal Reasoning

  11. LMM Modality Transfer: A Pre-requisite for Autonomous GIS Agents

    Aug 7, 2026Ivan Majic, Zexian Huang, Franziska Hübl +5Cross-Modal AlignmentMultimodal Large Language Models

  12. M3^3R-Bench: A Unified Benchmark for Evidence-Grounded Multimodal Metaphor Understanding

    Aug 6, 2026Hong Jiang, Junnan Zhu, Jingwang Huang +9Figurative Language UnderstandingMultimodal Reasoning

  13. Modality Agreement- and Conflict-Aware Prototype Hypergraph Learning for Multimodal Intent Understanding

    Aug 4, 2026Mohnish Raj, Suraj Kumar, Soumi Chattopadhayay +2Prototype LearningMultimodal Fusion

  14. Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning

    Aug 4, 2026Sahil Al Farib, Momota Ahsana Meem, Sheikh Redwanul Islam +1KG ConstructionMultimodal KGs

  15. CAPEval: A Decoupled Caption Evaluation across Understanding and Generation

    Aug 3, 2026Zhipeng Liu, Haochen Wang, Zhaoxiang ZhangImage CaptioningT2I Generation

  16. CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding

    Jul 31, 2026Wenxin Tang, Jingyu Xiao, Zhenyu Liu +6Efficient Multimodal InferenceMultimodal Large Language Models

  17. FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

    Jul 31, 2026Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino +2ClassificationMultimodal Model Evaluation

  18. Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

    Jul 28, 2026Jiaang Li, Chengzu Li, Zhaochong An +4VLM EvaluationMultimodal Large Language Models

  19. Monkey King Bang: A Unified Scientific Multimodal Foundation Model

    Jul 17, 2026Hesen Chen, Xinyu Su, Xiaomeng Yang +11AI for ScienceUnified Multimodal Models

  20. Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing

    Jul 9, 2026Dominick Reilly, Qiyu Wu, Hiromi Wakaki +2Missing-Modality LearningCross-Modal Representation Learning

  21. SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits

    Jul 9, 2026Adis Alihodzic, Selma Skopljakovic HubljarSHAP Feature AttributionMultimodal Emotion Recognition

  22. Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

    Jul 9, 2026Feng Wang, Canmiao Fu, Zhipeng Huang +3Multimodal MemoryEpisodic Memory

  23. DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

    Jul 9, 2026Pengjie Wang, Linger Deng, Zujia Zhang +6Efficient Multimodal InferenceUnified Multimodal Models

  24. Reinforcing the Generation Order of Multimodal Masked Diffusion Models

    Jul 9, 2026Yidong Ouyang, Zhe Wang, Sourav Bhabesh +1Text-Image AlignmentRL for Diffusion Models

  25. Vision as Unified Multimodal Generation

    Jul 7, 2026Xiaoyang Han, Jianhua Li, Kewang Deng +14Unified Multimodal ModelsMultimodal Generation

  26. CMDR: Contextual Multimodal Document Retrieval

    Jul 7, 2026Ryota Tanaka, Taku Hasegawa, Kyosuke NishidaMultimodal IRMultimodal Embedding

  27. Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts

    Jul 7, 2026Andrei-George Durdun, Victor Constantinescu, Radu Tudor IonescuCross-Modal LearningSentiment Analysis

  28. Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis

    Jul 6, 2026Zhipeng Xu, Zulong Chen, Qing Liu +6Synthetic Data GenerationDocument Information Extraction

  29. Hierarchical Evidence-Driven Reasoning for Long Document Understanding

    Jul 6, 2026Junyu Xiong, Yonghui Wang, Rongjian Gu +4Multi-Hop QADocument Understanding

  30. Transferability Between Understanding and Generation in Unified Multimodal Models

    Jul 5, 2026Jiwon Kang, Heeji Yoon, Jaewoo Jung +5Unified Multimodal ModelsMultimodal Generation

  31. Q-TriM: Question-Guided Tri-Modal Attention for Audio-Visual Question Answering

    Jul 4, 2026SungHun Kim, SeungJun BaekMultimodal QACross-Modal Attention

  32. Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

    Jul 4, 2026Zican Hu, Xuyang Hu, Yiming Liu +10Unified Multimodal ModelsMultimodal Reasoning

  33. Attending to Multimodal Generation One Token at a Time

    Jul 4, 2026Varun Gupta, Vineet Gandhi, Makarand TapaswiMultimodal Large Language ModelsMultimodal Generation

  34. Modality Relevance is not Modality Utility: Post-hoc Selective Modality Escalation for Cost-Aware Multimodal RAG

    Jul 3, 2026Xue Li, Yiming GaiMultimodal RAGEfficient Multimodal Inference

  35. OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

    Jul 3, 2026Shijie Cao, Qingyu Zhang, Boxi Yu +6Efficient Multimodal InferenceMultimodal Large Language Models

  36. Gemma 4 Technical Report

    Jul 2, 2026Gemma Team, Sherif El Abd, Vaibhav Aggarwal +298Efficient Multimodal InferenceUnified Multimodal Models

  37. Show Me Examples: Inferring Visual Concepts from Image Sets

    Jul 2, 2026Nick Stracke, Kolja Bauer, Stefan Andreas Baumann +3Vision-Language ModelsConditional Image Generation

  38. Hidden Forgetting in Continual Multimodal Learning: When Accuracy Survives but Grounding Fails

    Jul 2, 2026Qianyu Chen, Canran Xiao, Runxuan TangMultimodal GroundingMultimodal Foundation Models

  39. Towards High-Resolution Visual Perception via Hierarchical Entity Exploration

    Jul 1, 2026Ziyu Ma, Shidong Yang, Yuxiang Ji +5Large Vision-Language ModelsFine-Grained Visual Perception

  40. H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation

    Jul 1, 2026Qixiang Yin, Huanjin Yao, Yuchen Cai +5Cross-Modal Knowledge DistillationVLM Distillation

  41. Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning

    Jul 1, 2026Yixin Ji, Fanghua Ye, Juntao Li +5Long-Video UnderstandingMemory-Augmented Video Understanding

  42. Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning

    Jul 1, 2026Shijie Li, Yilin Gao, Siyuan Yang +7Multimodal Large Language ModelsLatent Visual Reasoning

  43. Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

    Jul 1, 2026Yoonhyung Park, Minji Kim, Sungwon Moon +1Visuo-Tactile Representation LearningMultimodal Large Language Models

  44. Rosetta: Composable Native Multimodal Pretraining

    Jul 1, 2026Xiangyue Liu, Zijian Zhang, Miles Yang +3Unified Multimodal ModelsMultimodal Pretraining

  45. CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts

    Jun 30, 2026Lianyu Hu, Shengqian Qin, Zeqin Liao +4Efficient Multimodal InferenceEfficient Language Model Reasoning

  46. Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference

    Jun 30, 2026Zhaoyang Luo, Runmin Dong, Miao Yang +4Efficient VLM InferenceMultimodal Large Language Models

  47. Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning

    Jun 30, 2026Kaitao Chen, Weiqian Zhao, Jiamin Wu +6Efficient Multimodal InferenceMedical VQA

  48. MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs

    Jun 30, 2026Zhongyang Li, Yaqian Li, Faming Fang +6Multimodal Large Language ModelsMultimodal Fusion

  49. Learning to Deny: Action Denial in Multimodal Large Language Models

    Jun 30, 2026Raiyaan Abdullah, Shehreen Azad, Yogesh Singh RawatMultimodal Large Language ModelsCausal Reasoning in Videos