Multimodal Understanding

Momentum

10 papers in the last four weeks, up 233% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 413

All topics
CardsList
  1. HNC: Leveraging Hard Negative Captions towards Models with Fine-Grained Visual-Linguistic Comprehension Capabilities

    May 6, 2026Esra Dönmez, Pascal Tilli, Hsiu-Yu Yang +2Cross-Modal LearningImage Matching

  2. To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition

    May 6, 2026Yangchen Yu, Qian Chen, Jia Li +5Cross-Modal LearningMultimodal Robustness

  3. ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval

    May 5, 2026Honglei Zhang, Yuting Chen, Chenpeng Hu +2Audio ReasoningAudio Understanding

  4. Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs

    May 4, 2026Xin Zhang, Qiqi Tao, Jiawei Du +2Inference-Time OptimizationTest-Time Optimization

  5. HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding

    May 4, 2026Haopeng Jin, Hongzhu Yi, Wenlong Zhao +6Video UnderstandingVideo-Language Models

  6. VIDA: A Dataset for Visually Dependent Ambiguity in Multimodal Machine Translation

    May 3, 2026Jingheng Pan, Xintong Wang, Longyue Wang +3Large Vision-Language ModelsMultimodal Model Evaluation

  7. Self-Captioning Multimodal Interaction Tuning: Amplifying Exploitable Redundancies for Robust Vision Language Models

    May 3, 2026Yuriel Ryan, Hei Man Ip, Adriel Kuek +2VLM RobustnessMultimodal Hallucination

  8. OmniEncoder: See, Hear, and Feel Continuous Motion Like Humans With One Encoder

    May 2, 2026Detao Bai, Shimin Yao, Weixuan Chen +4Cross-Modal LearningVideo Understanding

  9. Valley3: Scaling Omni Foundation Models for E-commerce

    May 2, 2026Zeyu Chen, Guanghao Zhou, Min Yang +6Unified Multimodal ModelsMultimodal Pretraining

  10. LIMSSR: LLM-Driven Sequence-to-Score Reasoning under Training-Time Incomplete Multimodal Observations

    May 1, 2026Huangbiao Xu, Huanqi Wu, Xiao Ke +1Missing-Modality LearningMultimodal Reasoning

  11. Group Cognition Learning: Making Everything Better Through Governed Two-Stage Agents Collaboration

    May 1, 2026Chunlei Meng, Pengbin Feng, Rong Fu +7Cross-Modal LearningMulti-Agent Collaboration

  12. Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

    Apr 30, 2026Sudong Wang, Weiquan Huang, Xiaomin Yu +9Multimodal Large Language ModelsMultimodal Reasoning

  13. COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts

    Apr 30, 2026Bingli Wang, Huanze Tang, Haijun Lv +5Vision-Language ModelsVision-Language Grounding

  14. M3^3-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

    Apr 28, 2026Jiatong Ma, Longteng Guo, Yuchen Liu +4Multimodal RAGVisual Question Answering

  15. Beyond Accuracy: Benchmarking Cross-Task Consistency in Unified Multimodal Models

    Apr 27, 2026Weixing Wang, Liudvikas Zekas, Anton Hackl +5Unified Multimodal ModelsCross-Modal Alignment

  16. Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation

    Apr 27, 2026Zhiheng Liu, Weiming Ren, Xiaoke Huang +12Unified Multimodal ModelsMultimodal Pretraining

  17. X2SAM: Any Segmentation in Images and Videos

    Apr 27, 2026Hao Wang, Limeng Qiao, Chi Zhang +4Image SegmentationVideo Object Segmentation

  18. Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning

    Apr 27, 2026Zhicheng Zhang, Wentao Gu, Weicheng Wang +5Audio-Visual UnderstandingTree Search

  19. Multimodal QUD: Inquisitive Questions from Scientific Figures

    Apr 26, 2026Yating Wu, William Rudman, Venkata S Govindarajan +2Multimodal GroundingScientific QA

  20. EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs

    Apr 25, 2026He Hu, Tengjin Weng, Zebang Cheng +5Multimodal Large Language ModelsMultimodal Model Evaluation