Multimodal Understanding

Momentum

10 papers in the last four weeks, up 233% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 416

All topics
CardsList
  1. Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning

    Jun 30, 2026Kaitao Chen, Weiqian Zhao, Jiamin Wu +6Efficient Multimodal InferenceMedical VQA

  2. MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs

    Jun 30, 2026Zhongyang Li, Yaqian Li, Faming Fang +6Multimodal Large Language ModelsMultimodal Fusion

  3. Learning to Deny: Action Denial in Multimodal Large Language Models

    Jun 30, 2026Raiyaan Abdullah, Shehreen Azad, Yogesh Singh RawatMultimodal Large Language ModelsCausal Reasoning in Videos

  4. Orca: The World is in Your Mind

    Jun 29, 2026Yihao Wang, Yuheng Ji, Mingyu Cao +54World Model LearningMultimodal Pretraining

  5. Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models

    Jun 29, 2026Kai Jiang, Ruishu Zhu, Siqi Huang +2Visual Question AnsweringMultimodal Large Language Models

  6. Reliability-Prioritized Fine-Grained Generation in Multimodal Large

    Jun 28, 2026Xiaomeng Fan, Wei Wu, Yuwei Wu +9Direct Preference OptimizationMultimodal Large Language Models

  7. MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein

    Jun 28, 2026Hong-Han Wang, Yuntao Wang, Hu DingLarge Vision-Language ModelsVLM Reasoning

  8. Personalizing MLLMs via Reinforced Multimodal Reference Game

    Jun 27, 2026Deepayan Das, Davide Talon, Yiming Wang +2Multimodal Large Language ModelsPersonalized Language Models

  9. COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models

    Jun 27, 2026Ziqi Zhou, Weize Quan, Mining Tan +6Multimodal GroundingUnified Multimodal Models

  10. Understanding How MLLMs Describe Artworks Using Token Activation Maps

    Jun 26, 2026Nicola Fanelli, Pasquale De Marinis, Raffaele Scaringi +3VLM InterpretabilityVision-Language Grounding

  11. MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy

    Jun 26, 2026Zhiyuan Han, Beier Zhu, Wenwen Tong +8RL for Language Model ReasoningMultimodal Large Language Models

  12. Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards

    Jun 25, 2026Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar +5Unified Multimodal ModelsMultimodal Generation

  13. ViQ: Text-Aligned Visual Quantized Representations at Any Resolution

    Jun 25, 2026Xumin Yu, Zuyan Liu, Zhenyu Yang +5Visual Representation LearningMultimodal Pretraining

  14. See & Sniff: Learning Visuo-Olfactory Representations

    Jun 25, 2026Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu +2Representation LearningCross-Modal Representation Learning

  15. Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation

    Jun 25, 2026Jinyu Liu, Xincheng Shuai, Henghui Ding +1Unified Multimodal ModelsMultimodal Foundation Models

  16. Bridging Vision and Language Concepts through Optimal Transport Semantic Flow

    Jun 25, 2026Chenyang Zhang, Anqi Dong, Guangming Zhu +4Concept Bottleneck ModelsVLM Interpretability

  17. Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning

    Jun 25, 2026Mengzhao Wang, Yanli Ji, Wangmeng Zuo +2Efficient Multimodal InferenceKV Caching

  18. What We are Missing in Multimodal LLM Evaluation?

    Jun 24, 2026Po-han Li, Shenghui Chen, Sandeep Chinchali +1Spatiotemporal ReasoningMultimodal Large Language Models

  19. TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs

    Jun 24, 2026Yu-Yang Chen, Lan-Zhe GuoSpatial Reasoning BenchmarksVisual Reasoning

  20. From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

    Jun 24, 2026Haoxiang Sun, Tao Wang, Li Yuan +2Vision-Language ModelsMultimodal Large Language Models

  21. SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity

    Jun 24, 2026Tianchen Guo, Chen Liu, Ling Chen +1Visual Question AnsweringMulti-View Consistency

  22. Omni-Perception Policy Optimization for Multimodal Emotion Reasoning

    Jun 24, 2026Zhiyuan Han, Beier Zhu, Wenwen Tong +6Multimodal ReasoningMultimodal Hallucination

  23. iFLYTEK-Embodied-Omni Technical Report

    Jun 24, 2026Yuan Zhang, Jingfei Ni, Guanchen Lu +12Unified Multimodal ModelsRobot Motion Generation

  24. ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering

    Jun 23, 2026Zhentao Guo, Chen Duan, Tongkun Guan +3Multimodal Large Language ModelsVideo QA

  25. AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

    Jun 23, 2026Yijing Chen, Wenhui Tan, Xiaoyi Yu +7Audio-Visual UnderstandingMultimodal Large Language Models