Multimodal Foundation Models

Latest papers 303

All topics
CardsList
  1. Jolia: Concept-Level Vision-Language Alignment for 3D CT Contrastive Learning

    Jun 23, 2026Julien Khlaut, Charles Corbière, Baptiste Callard +93D Foundation ModelsMedical Imaging Foundation Models

  2. Latent Visual States for Efficient Multimodal Reasoning

    Jun 23, 2026Xiuwei Chen, Wentao Hu, Yongxin Wang +8Efficient Multimodal InferenceLarge Vision-Language Models

  3. Mind the Heads: Topological Representation Alignment for Multimodal LLMs

    Jun 22, 2026Davide Caffagni, Alberto Compagnoni, Federico Melis +5Cross-Modal AlignmentMultimodal Large Language Models

  4. Foundation Models for Epileptogenic Zone Identification in Drug-Resistant Epilepsy

    Jun 21, 2026Thi Kieu Khanh Ho, Thomas Lai, Petr Klimes +5ElectroencephalographyMultimodal Foundation Models

  5. MMGist: A Comprehensive Multimodal Benchmark for 2027

    Jun 21, 2026Wenzhen Yuan, Jiacheng Ruan, Wutao Xiong +3VLM EvaluationLarge Vision-Language Models

  6. BioMatrix: Towards a Comprehensive Biological Foundation Model Spanning the Modality Matrix of Sequences, Structures, and Language

    Jun 20, 2026Qizhi Pei, Zhimeng Zhou, Yi Duan +9Unified Multimodal ModelsMultimodal Pretraining

  7. Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models

    Jun 18, 2026Yifeng Wu, Huimin Huang, Ruiluo Wu +5Visual Spatial ReasoningMultimodal Large Language Models

  8. 3D-PLOT-LLM: Part-Level Object Tokens for 3D Large Language Models

    Jun 18, 2026Jintang Xue, Xinyu Wang, Yixing Wu +23D Representation LearningMultimodal Foundation Models

  9. SAFE-Cascade: Cost-Adaptive Vision-Language Routing for Chart Question Answering

    Jun 17, 2026Ayush Dwivedi, Qixin Wang, Ashvi Soni +5Visual Question AnsweringEfficient VLM Inference

  10. Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games

    Jun 17, 2026Shengyuan Ding, Xilin Wei, Xinyu Fang +4Multimodal MemorySequential Decision Making

  11. Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

    Jun 17, 2026Pengyu Li, Zhitao Gao, Lingling Zhang +5Cross-Modal Knowledge DistillationEfficient Multimodal Inference

  12. Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification

    Jun 16, 2026Wujian Peng, Lingchen Meng, Yuxuan Cai +7Unified Multimodal ModelsAutoregressive Image Generation

  13. MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias

    Jun 16, 2026Xingming Li, Ao Cheng, Qiyao Sun +4VLM RobustnessVision-Language Models

  14. Gen-VCoT: Generative Visual Chain-of-Thought Reasoning via Diffusion-Based RGB Intermediate Representations

    Jun 15, 2026Zhiqiang Zhou, Junliang Dai, Xu lingVLM InterpretabilityMultimodal CoT Reasoning

  15. MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs

    Jun 15, 2026Yuanteng Chen, Peisong Wang, Zhilei Liu +9Mixed-Precision QuantizationLLM Quantization

  16. Probing, Fusion, and Trustworthiness: A Systematic Evaluation of Foundation Model Representations for Multimodal Cancer Analysis

    Jun 15, 2026Jingyu Hu, Giuseppe Tripodi, Reed Naidoo +2Computational PathologyMultimodal Robustness

  17. UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer

    Jun 15, 2026Shuai Wang, Liang Li, Yang Chen +3Diffusion TransformerUnified Multimodal Models

  18. OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

    Jun 14, 2026Zebang Cheng, Shuimu Chen, Boxue Yang +7On-Policy Self-DistillationMultimodal Large Language Models

  19. Forced Deferral: Manipulating Routing Decisions in Multimodal LLM Cascades

    Jun 13, 2026Zhongye Liu, Yaopei Zeng, Yurui Chang +1Adversarial Attacks on VLMsMultimodal Robustness

  20. Gaze Heads: How VLMs Look at What They Describe

    Jun 12, 2026Rohit Gandikota, David BauImage CaptioningVisual Attention

  21. OpenMedQ: Broad Open Pretraining for Medical Vision-Language Models

    Jun 11, 2026Ibrahim Gulluk, Max Van Puyvelde, Olivier GevaertMedical VQAMedical Image Classification

  22. GRIP: Feedback-Guided Prompt Retrieval for Large Multimodal Models

    Jun 10, 2026Garvita Allabadi, Matteo Sodano, Roberto Estevão +4Multimodal ICLMultimodal Large Language Models

  23. Emerging Flexible Designs for Geospatial Multimodal Foundation Models

    Jun 10, 2026Philipe Dias, Waqwoya Abebe, Abhishek Potnis +4Geospatial Foundation ModelsMultimodal Foundation Models

  24. InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning

    Jun 10, 2026Ziang Yan, Sheng Xia, Jiashuo Yu +10Efficient Multimodal InferenceMultimodal Reasoning

  25. Fine-tuning Multi-modal LLMs with ART: Art-based Reinforcement Training

    Jun 10, 2026Michal Chudoba, Sergey Alyaev, Petra Galuscakova +1LLM Fine-TuningMultimodal Large Language Models