Multimodal Foundation Models

Latest papers 303

All topics
CardsList
  1. MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

    Jul 8, 2026Hyunjae Kim, Dain Kim, Pan Xiao +25Medical Imaging Foundation ModelsTraining Data Curation

  2. ELSA3D: Elastic Semantic Anchoring for Unified 3D Understanding and Generation

    Jul 7, 2026Tianjiao Yu, Xinzhuo Li, Yifan Shen +43D Foundation ModelsUnified Multimodal Models

  3. Vision as Unified Multimodal Generation

    Jul 7, 2026Xiaoyang Han, Jianhua Li, Kewang Deng +14Unified Multimodal ModelsMultimodal Generation

  4. Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

    Jul 4, 2026Zican Hu, Xuyang Hu, Yiming Liu +10Unified Multimodal ModelsMultimodal Reasoning

  5. Attending to Multimodal Generation One Token at a Time

    Jul 4, 2026Varun Gupta, Vineet Gandhi, Makarand TapaswiMultimodal Large Language ModelsMultimodal Generation

  6. OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

    Jul 3, 2026Shijie Cao, Qingyu Zhang, Boxi Yu +6Efficient Multimodal InferenceMultimodal Large Language Models

  7. Gemma 4 Technical Report

    Jul 2, 2026Gemma Team, Sherif El Abd, Vaibhav Aggarwal +298Efficient Multimodal InferenceUnified Multimodal Models

  8. Hidden Forgetting in Continual Multimodal Learning: When Accuracy Survives but Grounding Fails

    Jul 2, 2026Qianyu Chen, Canran Xiao, Runxuan TangMultimodal GroundingMultimodal Foundation Models

  9. InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories

    Jul 2, 2026Qianyu Chen, Ziteng Feng, Canran Xiao +1Continual Learning for LLMsMemory-Efficient Fine-Tuning

  10. Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning

    Jul 1, 2026Shijie Li, Yilin Gao, Siyuan Yang +7Multimodal Large Language ModelsLatent Visual Reasoning

  11. Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

    Jul 1, 2026Yoonhyung Park, Minji Kim, Sungwon Moon +1Visuo-Tactile Representation LearningMultimodal Large Language Models

  12. Rosetta: Composable Native Multimodal Pretraining

    Jul 1, 2026Xiangyue Liu, Zijian Zhang, Miles Yang +3Unified Multimodal ModelsMultimodal Pretraining

  13. Decompose, Compare, and Decide: Multimodal LLMs are Implicit Few-Shot Learners

    Jun 30, 2026Yunhan Wang, Eshika Khandelwal, Edson Araujo +3Multimodal Large Language ModelsFew-Shot Prompting

  14. FedLAB: Traceable Semantic Codebooks for Federated Multimodal Graph Foundation Learning

    Jun 30, 2026Zekai Chen, Kairui Yang, Xuaner Chen +4Multimodal Federated LearningRepresentation Learning

  15. CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts

    Jun 30, 2026Lianyu Hu, Shengqian Qin, Zeqin Liao +4Efficient Multimodal InferenceEfficient Language Model Reasoning

  16. Rethinking Foundation Model Collaboration: Enhancing Specialized Models through Proxy Task Reasoning

    Jun 30, 2026Hongyi Lin, Yang Liu, Jinhua Zhao +1VLM ReasoningMultimodal Foundation Models

  17. Orca: The World is in Your Mind

    Jun 29, 2026Yihao Wang, Yuheng Ji, Mingyu Cao +54World Model LearningMultimodal Pretraining

  18. MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein

    Jun 28, 2026Hong-Han Wang, Yuntao Wang, Hu DingLarge Vision-Language ModelsVLM Reasoning

  19. COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models

    Jun 27, 2026Ziqi Zhou, Weize Quan, Mining Tan +6Multimodal GroundingUnified Multimodal Models

  20. Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards

    Jun 25, 2026Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar +5Unified Multimodal ModelsMultimodal Generation

  21. Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation

    Jun 25, 2026Jinyu Liu, Xincheng Shuai, Henghui Ding +1Unified Multimodal ModelsMultimodal Foundation Models

  22. ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP

    Jun 25, 2026Sicheng Zhang, Muzammal Naseer, Binzhu Xie +5Compositional ReasoningMultimodal Reasoning

  23. iFLYTEK-Embodied-Omni Technical Report

    Jun 24, 2026Yuan Zhang, Jingfei Ni, Guanchen Lu +12Unified Multimodal ModelsRobot Motion Generation