Multimodal Foundation Models

Latest papers 303

All topics
CardsList
  1. OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

    Jul 21, 2026Yu Chen, Caorui Li, Ziyu Xiong +8Temporal Video GroundingAudio-Visual Understanding

  2. Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio

    Jul 21, 2026Abdul Basit Tonmoy, Kazi Fardinul Hoque, Md. Shahrier Islam Arham +1VLM AdaptationMultimodal Embedding

  3. Now We Know? A Systematic Comparison of TerraMind and THOR

    Jul 20, 2026Frederick Schindlegger, Kenzo Bounegta, Eva Gmelich Meijling +5Geospatial Foundation ModelsRemote Sensing

  4. TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

    Jul 19, 2026Yuhan Zhu, Changlian Ma, Xiangyu Zeng +12Temporal Video GroundingReinforcement Learning

  5. One Modality to Forget Them All: Enhancing Cross-Modal Unlearning in Vision-Language Models

    Jul 17, 2026Sudharshan Balaji, Yili Ren, Guangjing Wang +2VLM UnlearningVLM Robustness

  6. Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

    Jul 17, 2026Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar +19Audio-Visual UnderstandingMultimodal Large Language Models

  7. Monkey King Bang: A Unified Scientific Multimodal Foundation Model

    Jul 17, 2026Hesen Chen, Xinyu Su, Xiaomeng Yang +11AI for ScienceUnified Multimodal Models

  8. Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models

    Jul 17, 2026Rakshanda Hassan Abhinandan, John Galeotti, Deva Ramanan +1Visual Question AnsweringVision-Language Models

  9. AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning

    Jul 16, 2026Sarthak Jain, Qiran Hu, Zhen Zhu +1Cross-Modal Representation LearningCross-Modal Alignment

  10. Video = World + Event Stream

    Jul 16, 2026Lianghua Huang, Zhi-Fan Wu, Yupeng Shi +24Audio-Visual UnderstandingStreaming Video Understanding

  11. Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment

    Jul 16, 2026Harikrishnan P M, Goutham Vignesh, Ganesh Parab +4Multimodal GroundingEfficient Multimodal Inference

  12. A Modern Multimodal Assistant on a 6 GB 2011 GPU: Stage-Validated, All-GPU CUDA Inference for Fermi

    Jul 16, 2026A. C. Opus, J. Q. LuEfficient Transformer InferenceGPU Kernel Optimization

  13. RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination

    Jul 15, 2026Haotian Liang, Mingkang Chen, Yufei Huang +27Unified Multimodal ModelsRobot Foundation Models

  14. FM2^2: Unified Federated Foundation Models for Heterogeneous Multimodal Medical Imaging

    Jul 15, 2026Shengchao Chen, Ting ShuMultimodal Federated LearningCross-Modal Alignment

  15. Hy-Embodied-VLM-1.0: Efficient Physical-World Agents

    Jul 14, 2026Ziyi Wang, Xumin Yu, Yongming Rao +19Efficient VLA ModelsMultimodal Foundation Models

  16. MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

    Jul 13, 2026Yuliang Liu, Zhang Li, Ziyang Zhang +11Document ParsingMultimodal Foundation Models

  17. LaGuadia: Language-Guided Adaptive Distillation from Pathology Foundation Models

    Jul 13, 2026Gangsu Kim, Won-Ki JeongComputational PathologyPathology Foundation Models

  18. A Foundation Model for Multimodal Event Sequences in Financial Applications

    Jul 10, 2026Nikita Rusakov, Vladislav Meshkov, Konstantin Zorin +4Financial ServicesMultimodal Pretraining

  19. ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts

    Jul 10, 2026Jiawen Li, Tian Guan, Huijuan Shi +5Computational PathologyUnified Multimodal Models

  20. Test-Time Scaling for Small VLMs on Multilingual Visual MCQ

    Jul 10, 2026Spiros Baxevanakis, Peng-Jian YangVisual Question AnsweringTest-Time Scaling for VLMs

  21. Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing

    Jul 9, 2026Dominick Reilly, Qiyu Wu, Hiromi Wakaki +2Missing-Modality LearningCross-Modal Representation Learning

  22. FabriVLA: A Lightweight Vision-Language-Action Model for Precise Multi-Task Manipulation

    Jul 9, 2026Shiyuan Yang, Borong Zhang, Jizheng Zhang +5Efficient VLA ModelsRobotic Manipulation

  23. Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning

    Jul 9, 2026Yiyang Fang, Pei Fu, Jinjie Li +7Efficient Multimodal InferenceRL for Language Model Reasoning

  24. DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

    Jul 9, 2026Pengjie Wang, Linger Deng, Zujia Zhang +6Efficient Multimodal InferenceUnified Multimodal Models

  25. Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

    Jul 8, 2026Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu +1VLM UnlearningMLLM Unlearning