Multimodal Foundation Models

Latest papers 303

All topics
CardsList
  1. Multimodal LLMs Can Learn to Read Brain Signals: A Vision--Language Model for Unified Multi-Task EEG Decoding

    Oct 7, 2026Parastoo Azizeddin, Omid Sharafi, Maryam M. ShanechiEEG DecodingMultimodal Foundation Models

  2. SAREO-FM: Decoupled Semantic Supervision for SAR-EO Foundation Models

    Oct 7, 2026Jeonghyeok Do, Munchurl KimRemote Sensing Image UnderstandingMultimodal Pretraining

  3. RoMod: Temporal Routing Modulation via Mixture-of-Experts for Video Anomaly Detection

    Oct 4, 2026Chao Huang, Pengfei Wei, Benfeng Wang +5Video Anomaly DetectionMultimodal Foundation Models

  4. ShieldCLIP: Selective Safety Alignment for Harmful Content Mitigation in Multimodal Foundation Models

    Sep 30, 2026Tobia Poppi, Silvia Cappelletti, Samuele Poppi +4Cross-Modal AlignmentMultimodal Foundation Models

  5. Language as the Interface: Foundation-Model Contrastive Learning Links Transcriptomes and Electrophysiology

    Sep 29, 2026Junbo Shen, Jinying Gao, Bo LeiCross-Modal AlignmentMultimodal Foundation Models

  6. AdaKerNet: Neural Kernel Decoding for Task-Adaptive Prediction with Multimodal Large Models

    Sep 28, 2026Konstantinos D. Polyzos, Eleni Oikonomou, Tara JavidiMultimodal Large Language ModelsKernel Methods

  7. InfiMed2: A Generalist Medical Multimodal Foundation Model from Contextual Evidence and Stability-Aware Supervision

    Sep 28, 2026Guanghao Zhu, Zeyu Liu, Zhitian Hou +9Multimodal PretrainingMultimodal QA

  8. AstraLOD3: Zero-shot multimodal agentic reconstruction of LOD3 building models

    Sep 23, 2026Bryan G. Pantoja-Rosero3D ReconstructionMulti-View 3D Reconstruction

  9. OmniFysics-Nano-V2 Technical Report: Understanding the Physical World Across Modalities

    Sep 22, 2026Yizhou Liu, Jinghang Han, Kaixiang Qiu +8Multimodal GroundingPhysical Reasoning

  10. A Language-Guided Multimodal Foundation Model for Zero-Shot and Multi-Task Brain Signal Analysis

    Sep 14, 2026Mingzhi Chen, Yiyu Gui, Guibo Luo +1Cross-Modal AlignmentMultimodal Foundation Models

  11. The Platonic brain bridge hypothesis: human brain networks as an architectural prior for multimodal large language models

    Sep 10, 2026Pengfei Zhang, Biao Tian, Xiangang Li +1Neural DecodingMultimodal Foundation Models

  12. Beyond Similarity: Foundation Models as an Efficient Backbone for Training-Free Composed Video Retrieval

    Sep 9, 2026Dmitry Demidov, Muhammad Zaigham Zaheer, Omkar Thawakar +2Multimodal Foundation ModelsComposed Video Retrieval

  13. NOAH: Learning the Full Patient Journey. A Longitudinal Multimodal Time-Aware Model for Representation and Forecasting

    Sep 8, 2026Tobias Susetzky, Raphael Rehms, Dmitrii Seletkov +5Irregular Time-Series ModelingClinical Prediction

  14. A Composable Evaluation System for Reproducible Omni-Modal Foundation Model Evaluation

    Sep 1, 2026Hodong Lee, Sanghee Park, Dohoon Ryu +4ML ReproducibilityMultimodal Foundation Models

  15. Fusion Anything: A Generalized Multimodal Foundation Model

    Aug 16, 2026Huizi Cui, Zongbo Han, Chenggong Ding +6Unified Multimodal ModelsMultimodal Pretraining

  16. CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation

    Aug 13, 2026Hamza Shafiq, Hung Manh Pham, Bin Zhu +3Cross-Modal Representation LearningJoint-Embedding Predictive Architecture

  17. Continuous-Latent Predictive Modeling with Semantic Alignment for EEG-Language Foundation Models

    Aug 12, 2026Myeong-Ju Cho, Hye-Bin Shin, Seo-Hyun Lee +1EEG DecodingPredictive Representation Learning

  18. Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation

    Aug 11, 2026Dazhao Du, Shiyan Du, Jian Liu +8Temporal Video GroundingMultimodal Foundation Models

  19. SapiensID 2.0: Aligning Human Recognition Foundation Models with Human Perception

    Aug 11, 2026Yiyang Su, Jie Zhu, Feng Liu +2Biometric IdentificationFace Recognition

  20. VOICE: A Vision-Omics Foundation Model Integrating Direct and Retrieval-Based Prediction of In-situ Single-Cell Gene Expression

    Aug 8, 2026Xin Luo, Yicheng Tao, Haoxuan Zeng +6Computational PathologySpatial Transcriptomics

  21. Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation

    Jul 30, 2026Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji +2Multimodal RobustnessAdversarial Attacks

  22. IndustryForge-27B: A Domain-Enhanced Multimodal Foundation Model for Industrial CAD

    Jul 30, 2026Nianchen Deng, Jiaxin Ai, Tao Hu +10Parametric CAD ModelingText-to-CAD Generation

  23. Color Fundus Photography Analysis: Co-evolution of Data, Preprocessing, and Modeling toward Multimodal AI

    Jul 27, 2026Yu Li, Wengan He, Wenhui Xu +7Medical Imaging Foundation ModelsMedical Image Analysis

  24. LunarFM: A Shared Multimodal Representation of the Moon's Surface

    Jul 24, 2026Marc Girona-Mata, Jakob Gawlikowski, Sumit Goski +6Geospatial Representation LearningMultimodal Pretraining

  25. Scaling Native Multimodal Pre-Training From Scratch

    Jul 24, 2026Haoyuan Wu, Aoqi Wu, Hai Wang +3Cross-Modal LearningMultimodal Pretraining

  26. OPOD: On-Policy Omni Distillation

    Jul 23, 2026Tong Zhao, Yuyang Hu, Yutao Zhu +5Cross-Modal Knowledge DistillationUnified Multimodal Models

  27. Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs

    Jul 22, 2026Pengcheng Wang, Zhiquan Wang, Jayoung Lee +5Efficient Multimodal InferenceEfficient VLM Inference

  28. Test-Time Training for Modality Order Consistency in Vision-Language Models

    Jul 22, 2026Aditi Gupta, Yossi GandelsmanVLM RobustnessVLM Adaptation