Multimodal Foundation Models

Latest papers 303

All topics
CardsList
  1. Multimodal LLMs Can Learn to Read Brain Signals: A Vision--Language Model for Unified Multi-Task EEG Decoding

    Oct 7, 2026Parastoo Azizeddin, Omid Sharafi, Maryam M. ShanechiEEG DecodingMultimodal Foundation Models

  2. SAREO-FM: Decoupled Semantic Supervision for SAR-EO Foundation Models

    Oct 7, 2026Jeonghyeok Do, Munchurl KimRemote Sensing Image UnderstandingMultimodal Pretraining

  3. RoMod: Temporal Routing Modulation via Mixture-of-Experts for Video Anomaly Detection

    Oct 4, 2026Chao Huang, Pengfei Wei, Benfeng Wang +5Video Anomaly DetectionMultimodal Foundation Models

  4. ShieldCLIP: Selective Safety Alignment for Harmful Content Mitigation in Multimodal Foundation Models

    Sep 30, 2026Tobia Poppi, Silvia Cappelletti, Samuele Poppi +4Cross-Modal AlignmentMultimodal Foundation Models

  5. Language as the Interface: Foundation-Model Contrastive Learning Links Transcriptomes and Electrophysiology

    Sep 29, 2026Junbo Shen, Jinying Gao, Bo LeiCross-Modal AlignmentMultimodal Foundation Models

  6. AdaKerNet: Neural Kernel Decoding for Task-Adaptive Prediction with Multimodal Large Models

    Sep 28, 2026Konstantinos D. Polyzos, Eleni Oikonomou, Tara JavidiMultimodal Large Language ModelsKernel Methods

  7. InfiMed2: A Generalist Medical Multimodal Foundation Model from Contextual Evidence and Stability-Aware Supervision

    Sep 28, 2026Guanghao Zhu, Zeyu Liu, Zhitian Hou +9Multimodal PretrainingMultimodal QA

  8. AstraLOD3: Zero-shot multimodal agentic reconstruction of LOD3 building models

    Sep 23, 2026Bryan G. Pantoja-Rosero3D ReconstructionMulti-View 3D Reconstruction

  9. OmniFysics-Nano-V2 Technical Report: Understanding the Physical World Across Modalities

    Sep 22, 2026Yizhou Liu, Jinghang Han, Kaixiang Qiu +8Multimodal GroundingPhysical Reasoning

  10. A Language-Guided Multimodal Foundation Model for Zero-Shot and Multi-Task Brain Signal Analysis

    Sep 14, 2026Mingzhi Chen, Yiyu Gui, Guibo Luo +1Cross-Modal AlignmentMultimodal Foundation Models

  11. The Platonic brain bridge hypothesis: human brain networks as an architectural prior for multimodal large language models

    Sep 10, 2026Pengfei Zhang, Biao Tian, Xiangang Li +1Neural DecodingMultimodal Foundation Models

  12. Beyond Similarity: Foundation Models as an Efficient Backbone for Training-Free Composed Video Retrieval

    Sep 9, 2026Dmitry Demidov, Muhammad Zaigham Zaheer, Omkar Thawakar +2Multimodal Foundation ModelsComposed Video Retrieval

  13. NOAH: Learning the Full Patient Journey. A Longitudinal Multimodal Time-Aware Model for Representation and Forecasting

    Sep 8, 2026Tobias Susetzky, Raphael Rehms, Dmitrii Seletkov +5Irregular Time-Series ModelingClinical Prediction

  14. A Composable Evaluation System for Reproducible Omni-Modal Foundation Model Evaluation

    Sep 1, 2026Hodong Lee, Sanghee Park, Dohoon Ryu +4ML ReproducibilityMultimodal Foundation Models

  15. Fusion Anything: A Generalized Multimodal Foundation Model

    Aug 16, 2026Huizi Cui, Zongbo Han, Chenggong Ding +6Unified Multimodal ModelsMultimodal Pretraining

  16. CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation

    Aug 13, 2026Hamza Shafiq, Hung Manh Pham, Bin Zhu +3Cross-Modal Representation LearningJoint-Embedding Predictive Architecture

  17. Continuous-Latent Predictive Modeling with Semantic Alignment for EEG-Language Foundation Models

    Aug 12, 2026Myeong-Ju Cho, Hye-Bin Shin, Seo-Hyun Lee +1EEG DecodingPredictive Representation Learning

  18. Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation

    Aug 11, 2026Dazhao Du, Shiyan Du, Jian Liu +8Temporal Video GroundingMultimodal Foundation Models

  19. SapiensID 2.0: Aligning Human Recognition Foundation Models with Human Perception

    Aug 11, 2026Yiyang Su, Jie Zhu, Feng Liu +2Biometric IdentificationFace Recognition

  20. VOICE: A Vision-Omics Foundation Model Integrating Direct and Retrieval-Based Prediction of In-situ Single-Cell Gene Expression

    Aug 8, 2026Xin Luo, Yicheng Tao, Haoxuan Zeng +6Computational PathologySpatial Transcriptomics

  21. Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation

    Jul 30, 2026Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji +2Multimodal RobustnessAdversarial Attacks

  22. IndustryForge-27B: A Domain-Enhanced Multimodal Foundation Model for Industrial CAD

    Jul 30, 2026Nianchen Deng, Jiaxin Ai, Tao Hu +10Parametric CAD ModelingText-to-CAD Generation

  23. Color Fundus Photography Analysis: Co-evolution of Data, Preprocessing, and Modeling toward Multimodal AI

    Jul 27, 2026Yu Li, Wengan He, Wenhui Xu +7Medical Imaging Foundation ModelsMedical Image Analysis

  24. LunarFM: A Shared Multimodal Representation of the Moon's Surface

    Jul 24, 2026Marc Girona-Mata, Jakob Gawlikowski, Sumit Goski +6Geospatial Representation LearningMultimodal Pretraining

  25. Scaling Native Multimodal Pre-Training From Scratch

    Jul 24, 2026Haoyuan Wu, Aoqi Wu, Hai Wang +3Cross-Modal LearningMultimodal Pretraining

  26. OPOD: On-Policy Omni Distillation

    Jul 23, 2026Tong Zhao, Yuyang Hu, Yutao Zhu +5Cross-Modal Knowledge DistillationUnified Multimodal Models

  27. Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs

    Jul 22, 2026Pengcheng Wang, Zhiquan Wang, Jayoung Lee +5Efficient Multimodal InferenceEfficient VLM Inference

  28. Test-Time Training for Modality Order Consistency in Vision-Language Models

    Jul 22, 2026Aditi Gupta, Yossi GandelsmanVLM RobustnessVLM Adaptation

  29. OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

    Jul 21, 2026Yu Chen, Caorui Li, Ziyu Xiong +8Temporal Video GroundingAudio-Visual Understanding

  30. Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio

    Jul 21, 2026Abdul Basit Tonmoy, Kazi Fardinul Hoque, Md. Shahrier Islam Arham +1VLM AdaptationMultimodal Embedding

  31. Now We Know? A Systematic Comparison of TerraMind and THOR

    Jul 20, 2026Frederick Schindlegger, Kenzo Bounegta, Eva Gmelich Meijling +5Geospatial Foundation ModelsRemote Sensing

  32. TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

    Jul 19, 2026Yuhan Zhu, Changlian Ma, Xiangyu Zeng +12Temporal Video GroundingReinforcement Learning

  33. One Modality to Forget Them All: Enhancing Cross-Modal Unlearning in Vision-Language Models

    Jul 17, 2026Sudharshan Balaji, Yili Ren, Guangjing Wang +2VLM UnlearningVLM Robustness

  34. Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

    Jul 17, 2026Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar +19Audio-Visual UnderstandingMultimodal Large Language Models

  35. Monkey King Bang: A Unified Scientific Multimodal Foundation Model

    Jul 17, 2026Hesen Chen, Xinyu Su, Xiaomeng Yang +11AI for ScienceUnified Multimodal Models

  36. Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models

    Jul 17, 2026Rakshanda Hassan Abhinandan, John Galeotti, Deva Ramanan +1Visual Question AnsweringVision-Language Models

  37. AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning

    Jul 16, 2026Sarthak Jain, Qiran Hu, Zhen Zhu +1Cross-Modal Representation LearningCross-Modal Alignment

  38. Video = World + Event Stream

    Jul 16, 2026Lianghua Huang, Zhi-Fan Wu, Yupeng Shi +24Audio-Visual UnderstandingStreaming Video Understanding

  39. Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment

    Jul 16, 2026Harikrishnan P M, Goutham Vignesh, Ganesh Parab +4Multimodal GroundingEfficient Multimodal Inference

  40. A Modern Multimodal Assistant on a 6 GB 2011 GPU: Stage-Validated, All-GPU CUDA Inference for Fermi

    Jul 16, 2026A. C. Opus, J. Q. LuEfficient Transformer InferenceGPU Kernel Optimization

  41. RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination

    Jul 15, 2026Haotian Liang, Mingkang Chen, Yufei Huang +27Unified Multimodal ModelsRobot Foundation Models

  42. FM2^2: Unified Federated Foundation Models for Heterogeneous Multimodal Medical Imaging

    Jul 15, 2026Shengchao Chen, Ting ShuMultimodal Federated LearningCross-Modal Alignment

  43. Hy-Embodied-VLM-1.0: Efficient Physical-World Agents

    Jul 14, 2026Ziyi Wang, Xumin Yu, Yongming Rao +19Efficient VLA ModelsMultimodal Foundation Models

  44. MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

    Jul 13, 2026Yuliang Liu, Zhang Li, Ziyang Zhang +11Document ParsingMultimodal Foundation Models

  45. LaGuadia: Language-Guided Adaptive Distillation from Pathology Foundation Models

    Jul 13, 2026Gangsu Kim, Won-Ki JeongComputational PathologyPathology Foundation Models

  46. A Foundation Model for Multimodal Event Sequences in Financial Applications

    Jul 10, 2026Nikita Rusakov, Vladislav Meshkov, Konstantin Zorin +4Financial ServicesMultimodal Pretraining

  47. ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts

    Jul 10, 2026Jiawen Li, Tian Guan, Huijuan Shi +5Computational PathologyUnified Multimodal Models

  48. Test-Time Scaling for Small VLMs on Multilingual Visual MCQ

    Jul 10, 2026Spiros Baxevanakis, Peng-Jian YangVisual Question AnsweringTest-Time Scaling for VLMs

  49. Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing

    Jul 9, 2026Dominick Reilly, Qiyu Wu, Hiromi Wakaki +2Missing-Modality LearningCross-Modal Representation Learning

  50. FabriVLA: A Lightweight Vision-Language-Action Model for Precise Multi-Task Manipulation

    Jul 9, 2026Shiyuan Yang, Borong Zhang, Jizheng Zhang +5Efficient VLA ModelsRobotic Manipulation

  51. Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning

    Jul 9, 2026Yiyang Fang, Pei Fu, Jinjie Li +7Efficient Multimodal InferenceRL for Language Model Reasoning

  52. DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

    Jul 9, 2026Pengjie Wang, Linger Deng, Zujia Zhang +6Efficient Multimodal InferenceUnified Multimodal Models

  53. Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

    Jul 8, 2026Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu +1VLM UnlearningMLLM Unlearning