Multimodal Understanding

Momentum

10 papers in the last four weeks, up 233% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 413

All topics
CardsList
  1. ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval

    May 5, 2026Honglei Zhang, Yuting Chen, Chenpeng Hu +2Audio ReasoningAudio Understanding

  2. Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs

    May 4, 2026Xin Zhang, Qiqi Tao, Jiawei Du +2Inference-Time OptimizationTest-Time Optimization

  3. HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding

    May 4, 2026Haopeng Jin, Hongzhu Yi, Wenlong Zhao +6Video UnderstandingVideo-Language Models

  4. VIDA: A Dataset for Visually Dependent Ambiguity in Multimodal Machine Translation

    May 3, 2026Jingheng Pan, Xintong Wang, Longyue Wang +3Large Vision-Language ModelsMultimodal Model Evaluation

  5. Self-Captioning Multimodal Interaction Tuning: Amplifying Exploitable Redundancies for Robust Vision Language Models

    May 3, 2026Yuriel Ryan, Hei Man Ip, Adriel Kuek +2VLM RobustnessMultimodal Hallucination

  6. OmniEncoder: See, Hear, and Feel Continuous Motion Like Humans With One Encoder

    May 2, 2026Detao Bai, Shimin Yao, Weixuan Chen +4Cross-Modal LearningVideo Understanding

  7. Valley3: Scaling Omni Foundation Models for E-commerce

    May 2, 2026Zeyu Chen, Guanghao Zhou, Min Yang +6Unified Multimodal ModelsMultimodal Pretraining

  8. LIMSSR: LLM-Driven Sequence-to-Score Reasoning under Training-Time Incomplete Multimodal Observations

    May 1, 2026Huangbiao Xu, Huanqi Wu, Xiao Ke +1Missing-Modality LearningMultimodal Reasoning

  9. Group Cognition Learning: Making Everything Better Through Governed Two-Stage Agents Collaboration

    May 1, 2026Chunlei Meng, Pengbin Feng, Rong Fu +7Cross-Modal LearningMulti-Agent Collaboration

  10. Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

    Apr 30, 2026Sudong Wang, Weiquan Huang, Xiaomin Yu +9Multimodal Large Language ModelsMultimodal Reasoning

  11. COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts

    Apr 30, 2026Bingli Wang, Huanze Tang, Haijun Lv +5Vision-Language ModelsVision-Language Grounding

  12. M3^3-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

    Apr 28, 2026Jiatong Ma, Longteng Guo, Yuchen Liu +4Multimodal RAGVisual Question Answering

  13. Beyond Accuracy: Benchmarking Cross-Task Consistency in Unified Multimodal Models

    Apr 27, 2026Weixing Wang, Liudvikas Zekas, Anton Hackl +5Unified Multimodal ModelsCross-Modal Alignment

  14. Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation

    Apr 27, 2026Zhiheng Liu, Weiming Ren, Xiaoke Huang +12Unified Multimodal ModelsMultimodal Pretraining

  15. X2SAM: Any Segmentation in Images and Videos

    Apr 27, 2026Hao Wang, Limeng Qiao, Chi Zhang +4Image SegmentationVideo Object Segmentation

  16. Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning

    Apr 27, 2026Zhicheng Zhang, Wentao Gu, Weicheng Wang +5Audio-Visual UnderstandingTree Search

  17. Multimodal QUD: Inquisitive Questions from Scientific Figures

    Apr 26, 2026Yating Wu, William Rudman, Venkata S Govindarajan +2Multimodal GroundingScientific QA

  18. EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs

    Apr 25, 2026He Hu, Tengjin Weng, Zebang Cheng +5Multimodal Large Language ModelsMultimodal Model Evaluation

  19. StoryTR: Narrative-Centric Video Temporal Retrieval with Theory of Mind Reasoning

    Apr 25, 2026Xuanyue Zhong, Yuqiang Xie, Guanqun Bi +2Temporal Video GroundingVideo Understanding

  20. CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding

    Apr 24, 2026Lihao Zheng, Zhenwei Shao, Yu Zhou +5Multimodal GroundingMultimodal Large Language Models

  21. Can Multimodal Large Language Models Truly Understand Small Objects?

    Apr 24, 2026Fujun Han, Junan Chen, Xintong Zhu +4Multimodal QAMultimodal Model Evaluation