Multimodal Understanding

Momentum

10 papers in the last four weeks, up 233% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 413

All topics
CardsList
  1. MMGist: A Comprehensive Multimodal Benchmark for 2027

    Jun 21, 2026Wenzhen Yuan, Jiacheng Ruan, Wutao Xiong +3VLM EvaluationLarge Vision-Language Models

  2. BioMatrix: Towards a Comprehensive Biological Foundation Model Spanning the Modality Matrix of Sequences, Structures, and Language

    Jun 20, 2026Qizhi Pei, Zhimeng Zhou, Yi Duan +9Unified Multimodal ModelsMultimodal Pretraining

  3. CulMind: Benchmarking Multimodal Understanding and Reasoning in Chinese Cultural Heritage

    Jun 19, 2026Zhangwei Cao, Shuhan Fan, Yuting Wei +5Benchmark ConstructionReasoning Evaluation

  4. Synergistic Dual-Branch Adaptation for Multi-modal Generalized Category Discovery

    Jun 19, 2026Yuxun Qu, Minyu Zhou, Yongqiang Tang +2Cross-Modal AlignmentMultimodal Classification

  5. CogniRoute: Learning to Route Social Evidence in Omni-Modal Models

    Jun 18, 2026Yifan Shen, Pei Tian, Xinzhuo Li +8RL for Language Model ReasoningMixture-of-Experts Inference

  6. ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models

    Jun 18, 2026Yihao Wang, Zijian He, Jie Ren +1Multimodal GroundingMultimodal Reasoning

  7. Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models

    Jun 18, 2026Yifeng Wu, Huimin Huang, Ruiluo Wu +5Visual Spatial ReasoningMultimodal Large Language Models

  8. 3D-PLOT-LLM: Part-Level Object Tokens for 3D Large Language Models

    Jun 18, 2026Jintang Xue, Xinyu Wang, Yixing Wu +23D Representation LearningMultimodal Foundation Models

  9. SAFE-Cascade: Cost-Adaptive Vision-Language Routing for Chart Question Answering

    Jun 17, 2026Ayush Dwivedi, Qixin Wang, Ashvi Soni +5Visual Question AnsweringEfficient VLM Inference

  10. Native Active Perception as Reasoning for Omni-Modal Understanding

    Jun 17, 2026Zhenghao Xing, Ruiyang Xu, Yuxuan Wang +8Audio-Visual UnderstandingActive Perception

  11. Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games

    Jun 17, 2026Shengyuan Ding, Xilin Wei, Xinyu Fang +4Multimodal MemorySequential Decision Making

  12. Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation

    Jun 17, 2026Sihan Wang, Xiyao Liu, Lianqing Liu +1Vision-Language ModelsOn-Policy Self-Distillation

  13. Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

    Jun 17, 2026Pengyu Li, Zhitao Gao, Lingling Zhang +5Cross-Modal Knowledge DistillationEfficient Multimodal Inference

  14. CaVe-VLM-CoT: An Interpretable Vision-Language Model Framework

    Jun 16, 2026Sneha Rao, Shaina Raza, Dhanesh RamachandramVLM EvaluationVision-Language Grounding

  15. Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification

    Jun 16, 2026Wujian Peng, Lingchen Meng, Yuxuan Cai +7Unified Multimodal ModelsAutoregressive Image Generation

  16. MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias

    Jun 16, 2026Xingming Li, Ao Cheng, Qiyao Sun +4VLM RobustnessVision-Language Models

  17. Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation

    Jun 15, 2026Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina +1VLM EvaluationMultilingual Language Models

  18. Gen-VCoT: Generative Visual Chain-of-Thought Reasoning via Diffusion-Based RGB Intermediate Representations

    Jun 15, 2026Zhiqiang Zhou, Junliang Dai, Xu lingVLM InterpretabilityMultimodal CoT Reasoning

  19. SPICE: Synergy and Partial Information Based Curriculum Evolution

    Jun 15, 2026Ankush Pratap Singh, Houwei Cao, Yong LiuCurriculum LearningMultimodal Learning

  20. LOCUS: Local Visual Cue Search for Enhancing Fine-Grained Perception in Multimodal Large Language Models

    Jun 15, 2026Zhou Tao, Fang Zhang, Zewen Ding +5Multimodal Large Language ModelsVision-Language Grounding

  21. MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs

    Jun 15, 2026Yuanteng Chen, Peisong Wang, Zhilei Liu +9Mixed-Precision QuantizationLLM Quantization

  22. UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer

    Jun 15, 2026Shuai Wang, Liang Li, Yang Chen +3Diffusion TransformerUnified Multimodal Models

  23. Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence

    Jun 14, 2026Xuanle Zhao, Qiushi Sun, Jingyu Xiao +16Scientific VisualizationCode Generation

  24. OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

    Jun 14, 2026Zebang Cheng, Shuimu Chen, Boxue Yang +7On-Policy Self-DistillationMultimodal Large Language Models

  25. Mitigating Visual Hallucinations in Multimodal Systems through Retrieval-Augmented Reliability-Aware Inference

    Jun 14, 2026Pratheswaran Hariharan, Haiping Xu, Donghui YanProbability CalibrationSelective Prediction

  26. Conditional Multi-Event Temporal Grounding in Long-Form Video

    Jun 13, 2026Yuanhao Zou, Arthad Kulkarni, Lucas Tonanez +12Temporal Video GroundingLong-Video Understanding

  27. Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning

    Jun 13, 2026Zhengbo Zhang, Changtao Miao, Jinbo Su +10Multimodal IRMultimodal Grounding

  28. DLWM: Diverse Latent World Models for Efficient Multimodal Reasoning

    Jun 13, 2026David Huang, Lianlei ShanEfficient Multimodal InferenceMultimodal Reasoning