Multimodal Understanding

Momentum

10 papers in the last four weeks, up 233% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 413

All topics
CardsList
  1. When Looking Is Not Enough: Visual Attention Structure Reveals Hallucination in MLLMs

    May 12, 2026Fanpu Cao, Xin Zou, Xuming Hu +1Hallucination Detection in VLMsHallucination in Language Models

  2. LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?

    May 11, 2026Xueqi Cheng, Yushun DongEfficient Multimodal InferenceMultimodal Large Language Models

  3. Count Anything at Any Granularity

    May 11, 2026Chang Liu, Haoning Wu, Weidi XieObject CountingMultimodal Large Language Models

  4. Probing Cross-modal Information Hubs in Audio-Visual LLMs

    May 11, 2026Jihoo Jung, Chaeyoung Jung, Ji-Hoon Kim +1Cross-Modal LearningMultimodal Large Language Models

  5. Phoenix-VL 1.5 Medium Technical Report

    May 11, 2026Team Phoenix, :, Arka Ray +30Multilingual Language ModelsDomain Adaptation

  6. Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought

    May 11, 2026Xuanchen Li, Yuheng Lu, Chenrui Cui +6Cross-Modal LearningMultimodal QA

  7. The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space

    May 11, 2026Xia Hu, Zhenrui Yue, Brian Potetz +4VLM EvaluationSpatial Reasoning Benchmarks

  8. Do multimodal models imagine electric sheep?

    May 10, 2026Santhosh Kumar Ramakrishnan, Carl Vondrick, Raja Giryes +2Visual Spatial ReasoningWorld Model Learning

  9. FLAME: Adaptive Mixture-of-Experts for Continual Multimodal Multi-Task Learning

    May 10, 2026Xing Han, Shravan Chaudhari, Tanvi Ranade +2Cross-Modal LearningHealthcare

  10. The Wittgensteinian Representation Hypothesis: Is Language the Attractor of Multimodal Convergence?

    May 10, 2026Zhaoyang Zhang, Run Shao, Dongyue Wu +4Neural Representation GeometryCross-Modal Alignment

  11. dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models

    May 10, 2026Zhengyan Wan, Yidong Ouyang, Panwen Hu +1Group Relative Policy OptimizationImage Generation

  12. DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

    May 10, 2026Rui Liu, Dian Yu, Zhenwen Liang +6Multimodal Large Language ModelsMultimodal Reward Modeling

  13. SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning

    May 10, 2026Kun Xiang, Terry Jingchen Zhang, Zirong Liu +15Cross-Modal LearningMultimodal Grounding

  14. Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology

    May 9, 2026Jucheng Hu, Zhangquan Chen, Yulin Chen +9Multimodal Large Language ModelsMultimodal Foundation Models

  15. How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A

    May 9, 2026YiJie Huang, Yiqun Zhang, Zhuoyue Jia +7Efficient VLM InferenceLarge Vision-Language Models

  16. DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding

    May 9, 2026Xiang Feng, Jiawei Zhou, Zhangfeng Huang +6LLM GroundingLLM Answer Verification

  17. Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search

    May 9, 2026Tao Yu, yiming ding, Shenghua Chai +16Multi-Hop QAMultimodal IR

  18. SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment

    May 9, 2026Weiren Zhao, Yi Dong, Cheng ChenHealthcareUnified Multimodal Models

  19. SYNCR: A Cross-Video Reasoning Benchmark with Synthetic Grounding

    May 8, 2026Sara Ghazanfari, Siddharth Garg, Prashanth Krishnamurthy +1Multimodal GroundingVideo Reasoning

  20. TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos

    May 8, 2026Hengyi Feng, Hao Liang, Mingrui Chen +6Audio-Visual UnderstandingMultimodal Hallucination

  21. Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning

    May 8, 2026Jin Cui, Xinyue Long, Xunyong Zhang +5Visual Spatial ReasoningVisual Reasoning

  22. Multimodal Emotion Recognition via Causal-Diffusion Bridge (Affect-Diff)

    May 7, 2026Ankit SanjyalClass-Imbalanced LearningMultimodal Emotion Recognition

  23. Steering Visual Generation in Unified Multimodal Models with Understanding Supervision

    May 7, 2026Zeyu Liu, Zanlin Ni, Yang Yue +5Unified Multimodal ModelsImage Generation

  24. The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation

    May 7, 2026Hoin Jung, Xiaoqian WangMultimodal RAGMultimodal Grounding

  25. HNC: Leveraging Hard Negative Captions towards Models with Fine-Grained Visual-Linguistic Comprehension Capabilities

    May 6, 2026Esra Dönmez, Pascal Tilli, Hsiu-Yu Yang +2Cross-Modal LearningImage Matching

  26. To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition

    May 6, 2026Yangchen Yu, Qian Chen, Jia Li +5Cross-Modal LearningMultimodal Robustness