Multimodal Understanding

Momentum

10 papers in the last four weeks, up 233% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 413

All topics
CardsList
  1. Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models

    May 15, 2026Yujun Tong, Dongliang Chang, Zijin Yin +3Unified Multimodal ModelsMultimodal Reasoning

  2. Attribute-Grounded Selective Reasoning for Artwork Emotion Understanding with Multimodal Large Language Models

    May 15, 2026Cheng Zhang, Yuer Liu, Zhiyu Zhou +2Feature AttributionMultimodal Large Language Models

  3. UAM: A Dual-Stream Perspective on Forgetting in VLA Training

    May 15, 2026Jianke Zhang, Yuanfei Luo, Yucheng Hu +6Robotic ManipulationVision-Language-Action Models

  4. GOMA: Toward Structure-Driven Multimodal Alignment from a Graph Signal Smoothing Perspective

    May 15, 2026Xu Wang, Xunkai Li, Yinlin Zhu +2Cross-Modal LearningMultimodal IR

  5. Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action

    May 14, 2026Yi Zhang, Yinda Chen, Che Liu +26Action-Conditioned Video GenerationUnified Multimodal Models

  6. From Scenes to Elements: Multi-Granularity Evidence Retrieval for Verifiable Multimodal RAG

    May 14, 2026Guanhua Chen, Chuyue Huang, Yutong Yao +4Multimodal RAGMultimodal Grounding

  7. SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding

    May 14, 2026Pengxin Xu, Xincheng Lin, Luping Xiao +5Fine-Grained Visual PerceptionMultimodal Understanding

  8. MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models

    May 14, 2026Xiyu Ren, Zhaowei Wang, Yiming Du +11VLM EvaluationMemory-Augmented VLMs

  9. Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

    May 14, 2026Tian Qin, Junzhe Chen, Yuqing Shi +3Efficient VLM InferenceHallucination in Language Models

  10. ViMU: Benchmarking Video Metaphorical Understanding

    May 14, 2026Qi Li, Xinchao WangVideo UnderstandingVideo QA

  11. Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs

    May 13, 2026Trung Nguyen Quang, Yiming Gao, Fanyi Pu +3Multimodal GroundingMultimodal Large Language Models

  12. Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

    May 13, 2026Qinwu Xu, Yifan Jiang, Haoyu RenMultimodal GroundingCoT Reasoning

  13. MMSkills: Towards Multimodal Skills for General Visual Agents

    May 13, 2026Kangning Zhang, Shuai Shao, Qingyao Li +8GUI AgentsLLM Agent Skill Learning

  14. GeoFlowVLM: Geometry-Aware Joint Uncertainty for Frozen Vision-Language Embedding

    May 13, 2026Mayank Nautiyal, Li Ju, Andreas Hellander +2Cross-Modal LearningFlow Matching

  15. When Vision Speaks for Sound

    May 13, 2026Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu +6Audio-Language Model EvaluationAudio-Visual Understanding

  16. DiM\textsuperscript{3}: Bridging Multilingual and Multimodal Models via Direction- and Magnitude-Aware Merging

    May 13, 2026Zijing Wang, Mingyang Wang, Ercong Nie +6Multilingual Language ModelsMultimodal Large Language Models

  17. SMA: Submodular Modality Aligner For Data Efficient Multimodal Learning

    May 13, 2026Truong Pham, Anay Majee, Rishabh IyerCross-Modal LearningCross-Modal Alignment

  18. MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence

    May 12, 2026Yifan Chen, Fei Yin, Qingyan Bai +2Multimodal ICLMultimodal Reasoning

  19. SynIB: Informational Bottleneck for Maximizing Synergy in Multimodal Learning

    May 12, 2026Konstantinos Kontras, Teodora Gagaleska, Thomas Strypsteen +4Cross-Modal LearningMultimodal Learning

  20. Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models

    May 12, 2026Yanting Miao, Yutao Sun, Dexin Wang +8Multimodal Large Language ModelsLatent Visual Reasoning

  21. G2^2TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models

    May 12, 2026Junxian Li, Kai Liu, Zizhong Ding +4Efficient Multimodal InferenceUnified Multimodal Models

  22. OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

    May 12, 2026Yuchen Deng, Zidang Cai, Hai-Tao Zheng +3Audio-Visual UnderstandingEfficient Multimodal Inference

  23. UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs

    May 12, 2026Houcheng Jiang, Jiajun Fu, Junfeng Fang +4Efficient Multimodal InferenceMultimodal Large Language Models

  24. OmniThoughtVis: A Scalable Distillation Pipeline for Deployable Multimodal Reasoning Models

    May 12, 2026Yuanhao Yue, Chengyu Wang, Yuanjie Lyu +2VLM DistillationMultimodal Reasoning