Multimodal Understanding

Momentum

10 papers in the last four weeks, up 233% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 413

All topics
CardsList
  1. ETCHR: Editing To Clarify and Harness Reasoning

    May 22, 2026Beichen Zhang, Yuhong Liu, Jinsong Li +3Tool Use in VLMsMultimodal Reasoning

  2. Cambrian-P: Pose-Grounded Video Understanding

    May 21, 2026Jihan Yang, Zifan Zhao, Xichen Pan +5Vision-Language ModelsCamera Pose Estimation

  3. Measuring Cross-Modal Synergy: A Benchmark for VLM Explainability

    May 21, 2026Joël Roman Ky, Salah Ghamizi, Maxime CordyVLM InterpretabilityShapley Value Attribution

  4. Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention

    May 21, 2026Changyuan Tian, Zhicong Lu, Huaxing Liu +7Multimodal Large Language ModelsMultimodal Reasoning

  5. LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

    May 21, 2026Yifan Dai, Zhenhua Wu, Bohan Zeng +18Cross-Modal LearningAudio-Visual Understanding

  6. Two-Stage Multimodal Framework for Emotion Mimicry Intensity Prediction

    May 21, 2026Dinithi Dissanayake, Shaveen Silva, Ovindu Atukorala +2Multimodal Emotion RecognitionMultimodal Fusion

  7. MM-Conv: A Multimodal Dataset and Benchmark for Context-Aware Grounding in 3D Dialogue

    May 20, 2026Anna Deichler, Jim O'Regan, Fethiye Irmak Dogan +4Query ReformulationVisually Grounded Reasoning

  8. Multimodal LLMs under Pairwise Modalities

    May 20, 2026Yan Li, Yunlong Deng, Yuewen Sun +3Cross-Modal LearningRepresentation Identifiability

  9. SAVER: Selective As-Needed Vision Evidence for Multimodal Information Extraction

    May 20, 2026Miaobo Hu, Shuhao Hu, Bokun Wang +5Relation ExtractionNamed Entity Recognition

  10. VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence

    May 20, 2026Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu +5VLM EvaluationVisual Question Answering

  11. Modular Multimodal Classification Without Fine-Tuning: A Simple Compositional Approach

    May 20, 2026Herman Bergström, Aditya Mehrotra, Rahul G. KrishnanMultimodal EmbeddingMultimodal Classification

  12. AffectVerse: Emotional World Models for Multimodal Affective Computing

    May 19, 2026Bo Zhao, Fanghua Ye, Yixin Ji +3Cross-Modal LearningMultimodal Large Language Models

  13. LMM-Track4D: Eliciting 4D Dynamic Reasoning in LMMs via Trajectory-Grounded Dialogue

    May 19, 2026Chaoyue Li, Yongxue Xu, Jie Feng +1Spatiotemporal ReasoningMultimodal Large Language Models

  14. HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding

    May 19, 2026Mengqi Shi, Haopeng ZhangMultimodal GroundingVideo Summarization

  15. Chronicle: A Multimodal Foundation Model for Joint Language and Time Series Understanding

    May 18, 2026Paul Quinlan, Jeremy Levasseur, Qingguo Li +1Cross-Modal LearningMultivariate Time Series Forecasting

  16. Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

    May 18, 2026Qianhao Yuan, Jie Lou, Xing Yu +4Multimodal Large Language ModelsOn-Policy Distillation

  17. Semantic Generative Tuning for Unified Multimodal Models

    May 18, 2026Songsong Yu, Yuxin Chen, Ying Shan +1Image SegmentationUnified Multimodal Models

  18. Lance: Unified Multimodal Modeling by Multi-Task Synergy

    May 18, 2026Fengyi Fu, Mengqi Huang, Shaojin Wu +10Unified Multimodal ModelsMulti-Task Learning

  19. OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding

    May 18, 2026Ruixiang Zhao, Jie Yang, Zijie Xin +4Audio-Visual UnderstandingStreaming Video Understanding

  20. RAVE: Re-Allocating Visual Attention in Large Multimodal Models

    May 18, 2026Xi Leng, Xinhong Ma, Ziqiang Dong +4Visual AttentionSelf-Attention

  21. MARS: Technical Report for the CASTLE Challenge at EgoVis 2026

    May 18, 2026Haoyu Zhang, Qiaohui Chu, Yisen Feng +4Egocentric Video QAEgocentric Video Understanding

  22. What Matters for Grocery Product Retrieval with Open Source Vision Language Models

    May 18, 2026Emmanuel G. Maminta, Rowel O. AtienzaVLM EvaluationFine-Grained Image Retrieval

  23. See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding

    May 18, 2026Boyuan Sun, Bowen Yin, Yuanming Li +2Cross-Modal LearningVideo Object Segmentation

  24. A More Word-like Image Tokenization for MLLMs

    May 18, 2026Hyun Lee, Hyemin Jeong, Yejin Kim +4Image TokenizationEfficient VLM Inference

  25. LatentUMM: Dual Latent Alignment for Unified Multimodal Models

    May 18, 2026Yinyi Luo, Wenwen Wang, Hayes Bai +2Cross-Modal LearningUnified Multimodal Models

  26. Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction

    May 17, 2026Chaoqun He, Mingyang Xiang, Yingjing Xu +5Multimodal Large Language ModelsMultimodal Agents

  27. Multilingual and Multimodal LLMs in the Wild: Building for Low-Resource Languages

    May 16, 2026Firoj Alam, Shammur Absar Chowdhury, Enamul Hoque PrinceCross-Modal AlignmentMultimodal Large Language Models