Multimodal Understanding

Momentum

10 papers in the last four weeks, up 233% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 413

All topics
CardsList
  1. Gaze Heads: How VLMs Look at What They Describe

    Jun 12, 2026Rohit Gandikota, David BauImage CaptioningVisual Attention

  2. When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models

    Jun 12, 2026Yinfeng Wang, Zhiyuan Yao, Zheren Fu +2VLM RobustnessMultimodal Large Language Models

  3. Latent World Recovery for Multimodal Learning with Missing Modalities

    Jun 10, 2026Hui Wang, Tianyu Ren, Joseph Butler +3Missing-Modality LearningCross-Modal Alignment

  4. Frozen Multimodal Embeddings for AI-Assisted Interview Assessment of Personality and Cognitive Ability

    Jun 10, 2026Kuo-En Hung, Hung-Yue Suen, Shih-Ching Yeh +1Multimodal FusionMultimodal Understanding

  5. MultiToP: Learning to Patch Visual Tokens to Mitigate Hallucinations in Video Large Multimodal Models

    Jun 10, 2026Yuansheng Gao, Wenbin Xing, Jiahao Yuan +4Video-Language ModelsMultimodal Foundation Models

  6. Information-Theoretic Decomposition for Multimodal Interaction Learning

    Jun 10, 2026Zequn Yang, Yake Wei, Haotian Ni +2Multimodal FusionMultimodal Learning

  7. Context-Aware Multimodal Claim Verification in Spoken Dialogues

    Jun 9, 2026Chaewan Chun, Delvin Ce Zhang, Dongwon LeeClaim VerificationAudio Understanding

  8. Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks

    Jun 9, 2026Miaoxin Cai, Guanqun Wang, Wei Zhang +6Remote Sensing Image UnderstandingMultimodal Grounding

  9. Kwai Keye-VL-2.0 Technical Report

    Jun 9, 2026Kwai Keye Team, Bin Wen, Changyi Liu +50Temporal Video GroundingLong-Context Modeling

  10. CoCoSI: Collaborative Cognitive Map Construction for Spatial Intelligence

    Jun 9, 2026Yiming Zhang, Ruoxuan Cao, Zhihang ZhongMultimodal Large Language ModelsMulti-Agent LLMs

  11. From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs

    Jun 8, 2026Wish Suharitdamrong, Muhammad Awais, Xiatian Zhu +1Efficient Multimodal InferenceMultimodal Large Language Models

  12. TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs

    Jun 8, 2026Momina Ahsan, Sarfraz Ahmad, Ming Shan Hee +2Document UnderstandingTable QA

  13. Language as a Sensor: Calibrated Spatial Belief Estimation in 3D Scenes from Natural Language

    Jun 7, 2026Aryan Naveen, Jason Xinyu Liu, Luca Carlone +1Vision-Language GroundingSemantic Mapping

  14. TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding

    Jun 7, 2026Lianyu Hu, Xiaoyu Ma, Zeqin Liao +1Multimodal Large Language ModelsMultimodal Reasoning

  15. ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?

    Jun 6, 2026Bin Zhu, Yanhao Jia, Kexin Zhao +12Physical ReasoningMultimodal QA

  16. Watch, Remember, Reason: Human-View Video Understanding with MLLMs

    Jun 5, 2026Jiahao Meng, Yue Tan, Qi Xu +12Streaming Video UnderstandingVideo-Language Models

  17. M3^3Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions

    Jun 5, 2026Zhengjun Huang, Wenxuan Liu, Zhoujin Tian +6Multimodal GroundingEfficient Multimodal Inference

  18. FLOWREADER: Min-Cost Flow Optimization for Multi-Modal Long Document Q&A

    Jun 5, 2026Ambuj Mehrish, Sebastiano VasconMultimodal RAGMultimodal QA

  19. MMLongEmbed: Benchmarking Multimodal Embedding Models in Long-Context Scenarios

    Jun 5, 2026Haitian Wang, Ruoxi Sun, Quantong Qiu +5Multimodal IRMultimodal Embedding

  20. GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention

    Jun 4, 2026Giordano Cicchetti, Eleonora Grassucci, Danilo ComminielloCross-AttentionMultimodal Fusion

  21. To Be Multimodal or Not to Be: Query-Adaptive Audio-Visual Person Retrieval via Active Modality Detection

    Jun 4, 2026Erfan Loweimi, Mengjie Qian, Kate Knill +7Missing-Modality LearningAudio-Visual Understanding

  22. WorldBench: A Challenging and Visually Diverse Multimodal Reasoning Benchmark

    Jun 4, 2026Yida Yin, Harish Krishnakumar, Chung Peng Lee +9Multimodal Large Language ModelsMultimodal Reasoning

  23. Almieyar-Oryx-BloomBench: A Bilingual Multimodal Benchmark for Cognitively Informed Evaluation of Vision-Language Models

    Jun 4, 2026Mohammad Mahdi Abootorabi, Omid Ghahroodi, Anas Madkoor +4VLM EvaluationMultilingual VLM Evaluation