Multimodal Understanding

Momentum

10 papers in the last four weeks, up 233% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 413

All topics
CardsList
  1. Orca: The World is in Your Mind

    Jun 29, 2026Yihao Wang, Yuheng Ji, Mingyu Cao +54World Model LearningMultimodal Pretraining

  2. Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models

    Jun 29, 2026Kai Jiang, Ruishu Zhu, Siqi Huang +2Visual Question AnsweringMultimodal Large Language Models

  3. Reliability-Prioritized Fine-Grained Generation in Multimodal Large

    Jun 28, 2026Xiaomeng Fan, Wei Wu, Yuwei Wu +9Direct Preference OptimizationMultimodal Large Language Models

  4. MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein

    Jun 28, 2026Hong-Han Wang, Yuntao Wang, Hu DingLarge Vision-Language ModelsVLM Reasoning

  5. Personalizing MLLMs via Reinforced Multimodal Reference Game

    Jun 27, 2026Deepayan Das, Davide Talon, Yiming Wang +2Multimodal Large Language ModelsPersonalized Language Models

  6. COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models

    Jun 27, 2026Ziqi Zhou, Weize Quan, Mining Tan +6Multimodal GroundingUnified Multimodal Models

  7. Understanding How MLLMs Describe Artworks Using Token Activation Maps

    Jun 26, 2026Nicola Fanelli, Pasquale De Marinis, Raffaele Scaringi +3VLM InterpretabilityVision-Language Grounding

  8. MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy

    Jun 26, 2026Zhiyuan Han, Beier Zhu, Wenwen Tong +8RL for Language Model ReasoningMultimodal Large Language Models

  9. Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards

    Jun 25, 2026Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar +5Unified Multimodal ModelsMultimodal Generation

  10. ViQ: Text-Aligned Visual Quantized Representations at Any Resolution

    Jun 25, 2026Xumin Yu, Zuyan Liu, Zhenyu Yang +5Visual Representation LearningMultimodal Pretraining

  11. See & Sniff: Learning Visuo-Olfactory Representations

    Jun 25, 2026Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu +2Representation LearningCross-Modal Representation Learning

  12. Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation

    Jun 25, 2026Jinyu Liu, Xincheng Shuai, Henghui Ding +1Unified Multimodal ModelsMultimodal Foundation Models

  13. Bridging Vision and Language Concepts through Optimal Transport Semantic Flow

    Jun 25, 2026Chenyang Zhang, Anqi Dong, Guangming Zhu +4Concept Bottleneck ModelsVLM Interpretability

  14. Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning

    Jun 25, 2026Mengzhao Wang, Yanli Ji, Wangmeng Zuo +2Efficient Multimodal InferenceKV Caching

  15. What We are Missing in Multimodal LLM Evaluation?

    Jun 24, 2026Po-han Li, Shenghui Chen, Sandeep Chinchali +1Spatiotemporal ReasoningMultimodal Large Language Models

  16. TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs

    Jun 24, 2026Yu-Yang Chen, Lan-Zhe GuoSpatial Reasoning BenchmarksVisual Reasoning

  17. From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

    Jun 24, 2026Haoxiang Sun, Tao Wang, Li Yuan +2Vision-Language ModelsMultimodal Large Language Models

  18. SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity

    Jun 24, 2026Tianchen Guo, Chen Liu, Ling Chen +1Visual Question AnsweringMulti-View Consistency

  19. Omni-Perception Policy Optimization for Multimodal Emotion Reasoning

    Jun 24, 2026Zhiyuan Han, Beier Zhu, Wenwen Tong +6Multimodal ReasoningMultimodal Hallucination

  20. iFLYTEK-Embodied-Omni Technical Report

    Jun 24, 2026Yuan Zhang, Jingfei Ni, Guanchen Lu +12Unified Multimodal ModelsRobot Motion Generation

  21. ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering

    Jun 23, 2026Zhentao Guo, Chen Duan, Tongkun Guan +3Multimodal Large Language ModelsVideo QA

  22. AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

    Jun 23, 2026Yijing Chen, Wenhui Tan, Xiaoyi Yu +7Audio-Visual UnderstandingMultimodal Large Language Models

  23. Latent Visual States for Efficient Multimodal Reasoning

    Jun 23, 2026Xiuwei Chen, Wentao Hu, Yongxin Wang +8Efficient Multimodal InferenceLarge Vision-Language Models

  24. 4DVLT: Dynamic Scene Understanding with Worldline-Centered Vision-Language Tracking

    Jun 21, 2026Chaoyue Li, Boxue Yang, Shengyao Zhou +3Visual Object TrackingVision-Language Grounding

  25. Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do

    Jun 21, 2026Zhuoran Jin, Kejian Zhu, Hongbang Yuan +5Multimodal ReasoningVLM Reasoning