Multimodal Foundation Models

Latest papers 303

All topics
CardsList
  1. Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

    May 18, 2026Qianhao Yuan, Jie Lou, Xing Yu +4Multimodal Large Language ModelsOn-Policy Distillation

  2. Lance: Unified Multimodal Modeling by Multi-Task Synergy

    May 18, 2026Fengyi Fu, Mengqi Huang, Shaojin Wu +10Unified Multimodal ModelsMulti-Task Learning

  3. RAVE: Re-Allocating Visual Attention in Large Multimodal Models

    May 18, 2026Xi Leng, Xinhong Ma, Ziqiang Dong +4Visual AttentionSelf-Attention

  4. A More Word-like Image Tokenization for MLLMs

    May 18, 2026Hyun Lee, Hyemin Jeong, Yejin Kim +4Image TokenizationEfficient VLM Inference

  5. LatentUMM: Dual Latent Alignment for Unified Multimodal Models

    May 18, 2026Yinyi Luo, Wenwen Wang, Hayes Bai +2Cross-Modal LearningUnified Multimodal Models

  6. Multilingual and Multimodal LLMs in the Wild: Building for Low-Resource Languages

    May 16, 2026Firoj Alam, Shammur Absar Chowdhury, Enamul Hoque PrinceCross-Modal AlignmentMultimodal Large Language Models

  7. DarkLLM: Learning Language-Driven Adversarial Attacks with Large Language Models

    May 15, 2026Ye Sun, Xin Wang, Jiaming Zhang +7Adversarial Attacks on VLMsAdversarial Perturbations

  8. Unlocking Dense Metric Depth Estimation in VLMs

    May 15, 2026Hanxun Yu, Xuan Qu, Yuxin Wang +2Vision-Language ModelsMetric Depth Estimation

  9. Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models

    May 15, 2026Yujun Tong, Dongliang Chang, Zijin Yin +3Unified Multimodal ModelsMultimodal Reasoning

  10. Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action

    May 14, 2026Yi Zhang, Yinda Chen, Che Liu +26Action-Conditioned Video GenerationUnified Multimodal Models

  11. Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

    May 14, 2026Tian Qin, Junzhe Chen, Yuqing Shi +3Efficient VLM InferenceHallucination in Language Models

  12. Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs

    May 13, 2026Trung Nguyen Quang, Yiming Gao, Fanyi Pu +3Multimodal GroundingMultimodal Large Language Models

  13. Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

    May 13, 2026Qinwu Xu, Yifan Jiang, Haoyu RenMultimodal GroundingCoT Reasoning

  14. GeoFlowVLM: Geometry-Aware Joint Uncertainty for Frozen Vision-Language Embedding

    May 13, 2026Mayank Nautiyal, Li Ju, Andreas Hellander +2Cross-Modal LearningFlow Matching

  15. When Vision Speaks for Sound

    May 13, 2026Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu +6Audio-Language Model EvaluationAudio-Visual Understanding

  16. DiM\textsuperscript{3}: Bridging Multilingual and Multimodal Models via Direction- and Magnitude-Aware Merging

    May 13, 2026Zijing Wang, Mingyang Wang, Ercong Nie +6Multilingual Language ModelsMultimodal Large Language Models

  17. SMA: Submodular Modality Aligner For Data Efficient Multimodal Learning

    May 13, 2026Truong Pham, Anay Majee, Rishabh IyerCross-Modal LearningCross-Modal Alignment

  18. Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models

    May 12, 2026Yanting Miao, Yutao Sun, Dexin Wang +8Multimodal Large Language ModelsLatent Visual Reasoning

  19. OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

    May 12, 2026Yuchen Deng, Zidang Cai, Hai-Tao Zheng +3Audio-Visual UnderstandingEfficient Multimodal Inference

  20. LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?

    May 11, 2026Xueqi Cheng, Yushun DongEfficient Multimodal InferenceMultimodal Large Language Models

  21. Qwen-Image-2.0 Technical Report

    May 11, 2026Bing Zhao, Chenfei Wu, Deqing Li +72T2I GenerationCompositional T2I Generation

  22. Phoenix-VL 1.5 Medium Technical Report

    May 11, 2026Team Phoenix, :, Arka Ray +30Multilingual Language ModelsDomain Adaptation

  23. The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space

    May 11, 2026Xia Hu, Zhenrui Yue, Brian Potetz +4VLM EvaluationSpatial Reasoning Benchmarks