Multimodal Understanding

Momentum

10 papers in the last four weeks, up 233% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 413

All topics
CardsList
  1. Vision as Unified Multimodal Generation

    Jul 7, 2026Xiaoyang Han, Jianhua Li, Kewang Deng +14Unified Multimodal ModelsMultimodal Generation

  2. CMDR: Contextual Multimodal Document Retrieval

    Jul 7, 2026Ryota Tanaka, Taku Hasegawa, Kyosuke NishidaMultimodal IRMultimodal Embedding

  3. Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts

    Jul 7, 2026Andrei-George Durdun, Victor Constantinescu, Radu Tudor IonescuCross-Modal LearningSentiment Analysis

  4. Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis

    Jul 6, 2026Zhipeng Xu, Zulong Chen, Qing Liu +6Synthetic Data GenerationDocument Information Extraction

  5. Hierarchical Evidence-Driven Reasoning for Long Document Understanding

    Jul 6, 2026Junyu Xiong, Yonghui Wang, Rongjian Gu +4Multi-Hop QADocument Understanding

  6. Transferability Between Understanding and Generation in Unified Multimodal Models

    Jul 5, 2026Jiwon Kang, Heeji Yoon, Jaewoo Jung +5Unified Multimodal ModelsMultimodal Generation

  7. Q-TriM: Question-Guided Tri-Modal Attention for Audio-Visual Question Answering

    Jul 4, 2026SungHun Kim, SeungJun BaekMultimodal QACross-Modal Attention

  8. Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

    Jul 4, 2026Zican Hu, Xuyang Hu, Yiming Liu +10Unified Multimodal ModelsMultimodal Reasoning

  9. Attending to Multimodal Generation One Token at a Time

    Jul 4, 2026Varun Gupta, Vineet Gandhi, Makarand TapaswiMultimodal Large Language ModelsMultimodal Generation

  10. Modality Relevance is not Modality Utility: Post-hoc Selective Modality Escalation for Cost-Aware Multimodal RAG

    Jul 3, 2026Xue Li, Yiming GaiMultimodal RAGEfficient Multimodal Inference

  11. OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

    Jul 3, 2026Shijie Cao, Qingyu Zhang, Boxi Yu +6Efficient Multimodal InferenceMultimodal Large Language Models

  12. Gemma 4 Technical Report

    Jul 2, 2026Gemma Team, Sherif El Abd, Vaibhav Aggarwal +298Efficient Multimodal InferenceUnified Multimodal Models

  13. Show Me Examples: Inferring Visual Concepts from Image Sets

    Jul 2, 2026Nick Stracke, Kolja Bauer, Stefan Andreas Baumann +3Vision-Language ModelsConditional Image Generation

  14. Hidden Forgetting in Continual Multimodal Learning: When Accuracy Survives but Grounding Fails

    Jul 2, 2026Qianyu Chen, Canran Xiao, Runxuan TangMultimodal GroundingMultimodal Foundation Models

  15. Towards High-Resolution Visual Perception via Hierarchical Entity Exploration

    Jul 1, 2026Ziyu Ma, Shidong Yang, Yuxiang Ji +5Large Vision-Language ModelsFine-Grained Visual Perception

  16. H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation

    Jul 1, 2026Qixiang Yin, Huanjin Yao, Yuchen Cai +5Cross-Modal Knowledge DistillationVLM Distillation

  17. Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning

    Jul 1, 2026Yixin Ji, Fanghua Ye, Juntao Li +5Long-Video UnderstandingMemory-Augmented Video Understanding

  18. Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning

    Jul 1, 2026Shijie Li, Yilin Gao, Siyuan Yang +7Multimodal Large Language ModelsLatent Visual Reasoning

  19. Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

    Jul 1, 2026Yoonhyung Park, Minji Kim, Sungwon Moon +1Visuo-Tactile Representation LearningMultimodal Large Language Models

  20. Rosetta: Composable Native Multimodal Pretraining

    Jul 1, 2026Xiangyue Liu, Zijian Zhang, Miles Yang +3Unified Multimodal ModelsMultimodal Pretraining

  21. CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts

    Jun 30, 2026Lianyu Hu, Shengqian Qin, Zeqin Liao +4Efficient Multimodal InferenceEfficient Language Model Reasoning

  22. Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference

    Jun 30, 2026Zhaoyang Luo, Runmin Dong, Miao Yang +4Efficient VLM InferenceMultimodal Large Language Models

  23. Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning

    Jun 30, 2026Kaitao Chen, Weiqian Zhao, Jiamin Wu +6Efficient Multimodal InferenceMedical VQA

  24. MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs

    Jun 30, 2026Zhongyang Li, Yaqian Li, Faming Fang +6Multimodal Large Language ModelsMultimodal Fusion

  25. Learning to Deny: Action Denial in Multimodal Large Language Models

    Jun 30, 2026Raiyaan Abdullah, Shehreen Azad, Yogesh Singh RawatMultimodal Large Language ModelsCausal Reasoning in Videos