Multimodal Pretraining

Latest papers 121

All topics
CardsList
  1. KAST-BAR: Knowledge-Anchored Semantically-Dynamic Topology Brain Autoregressive Modeling for Universal Neural Interpretation

    May 13, 2026Haoning Wang, Wenchao Yang, Shuai Shen +1EEG DecodingMultimodal Pretraining

  2. BrainAnytime: Anatomy-Aware Cross-Modal Pretraining for Brain Image Analysis with Arbitrary Modality Availability

    May 13, 2026Guangqian Yang, Tong Ding, Wenlong Hou +4Missing-Modality LearningMasked Autoencoders

  3. Phoenix-VL 1.5 Medium Technical Report

    May 11, 2026Team Phoenix, :, Arka Ray +30Multilingual Language ModelsDomain Adaptation

  4. MultiMedVision: Multi-Modal Medical Vision Framework

    May 9, 2026Frank Li, Bardia Khosravi, Mohammadreza Chavoshi +5Medical Imaging Foundation ModelsVision Transformer

  5. Anisotropic Modality Align

    May 8, 2026Xiaomin Yu, Yijiang Li, Yuhui Zhang +8Cross-Modal LearningCross-Modal Alignment

  6. Pan-FM: A Pan-Organ Foundation Model with Saliency-Guided Masking for Missing Robustness

    May 8, 2026Qiangqiang Wu, Grace McIlvain, Zhou Yu +1Missing-Modality LearningMedical Imaging

  7. TRAJGANR: Trajectory-Centric Urban Multimodal Learning via Geospatially Aligned Neural Representations

    May 7, 2026Maria Despoina Siampou, Gengchen Mai, Ni Lao +4Geospatial Foundation ModelsCross-Modal Alignment

  8. Knowledge Transfer Scaling Laws for 3D Medical Imaging

    May 7, 2026Ho Hin Lee, Dongna Du, Chu Wang +4Medical Imaging Foundation Models3D Medical Imaging

  9. Audio-Visual Intelligence in Large Foundation Models

    May 5, 2026You Qin, Kai Liu, Shengqiong Wu +12Audio-Visual UnderstandingAudio-Video Generation

  10. Valley3: Scaling Omni Foundation Models for E-commerce

    May 2, 2026Zeyu Chen, Guanghao Zhou, Min Yang +6Unified Multimodal ModelsMultimodal Pretraining

  11. A Multimodal Pre-trained Network for Integrated EEG-Video Seizure Detection

    Apr 29, 2026Tong Lu, Ke Xu, Zimo Zhang +12ElectroencephalographyEEG Seizure Detection

  12. Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation

    Apr 27, 2026Zhiheng Liu, Weiming Ren, Xiaoke Huang +12Unified Multimodal ModelsMultimodal Pretraining

  13. OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

    Apr 25, 2026Yida Xue, Ningyu Zhang, Tingwei Wu +5AI for ScienceMultimodal Pretraining

  14. CheXmix: Unified Generative Pretraining for Vision Language Models in Medical Imaging

    Apr 24, 2026Ashwin Kumar, Robbie Holland, Corey Barrett +8Radiology Report GenerationChest X-Ray Classification

  15. Context Unrolling in Omni Models

    Apr 23, 2026Ceyuan Yang, Zhijie Lin, Yang Zhao +16Cross-Modal LearningUnified Multimodal Models

  16. Multimodal Transformer for Sample-Aware Prediction of Metal-Organic Framework Properties

    Apr 21, 2026Seunghee Han, Jaewoong Lee, Jihan KimMultimodal PretrainingMaterials Property Prediction

  17. Better with Less: Tackling Heterogeneous Multi-Modal Image Joint Pretraining via Conditioned and Degraded Masked Autoencoder

    Apr 18, 2026Bowen Peng, Yongxiang Liu, Jie Zhou +4Cross-Modal LearningMasked Autoencoders

  18. PivotMerge: Bridging Heterogeneous Multimodal Pre-training via Post-Alignment Model Merging

    Apr 18, 2026Zibo Shao, Baochen Xiong, Xiaoshan Yang +4Cross-Modal LearningCross-Modal Alignment

  19. MedP-CLIP: Medical CLIP with Region-Aware Prompt Integration

    Apr 13, 2026Jiahui Peng, He Yao, Jingwen Li +9Promptable Image SegmentationMultimodal Pretraining

  20. Overcoming the Modality Gap in Context-Aided Forecasting

    Mar 12, 2026Vincent Zhihao Zheng, Étienne Marcotte, Arjun Ashok +4Synthetic Data AugmentationMultimodal Pretraining

  21. GreenRFM: Learning a resource-efficient radiology vision-language foundation model via supervision-centric pre-training

    Mar 6, 2026Yingtai Li, Shuai Ming, Qiuli Wang +13Medical Imaging Foundation ModelsRadiology VLMs

  22. MPFlow: Multi-modal Posterior-Guided Flow Matching for Zero-Shot MRI Reconstruction

    Mar 4, 2026Seunghoi Kim, Chen Jin, Henry F. J. Tregidgo +2Cross-Modal AlignmentMultimodal Pretraining

  23. MedGPT-oss: Training a General-Purpose Vision-Language Model for Biomedicine

    Mar 1, 2026Kai Zhang, Zhengqing Yuan, Cheng Peng +10HealthcareMultimodal Pretraining

  24. SleepLM: Natural-Language Intelligence for Human Sleep

    Feb 27, 2026Zongzhe Xu, Zitao Shuai, Eideen Mozaffari +3Multimodal PretrainingCross-Modal Retrieval

  25. PRIMA: Pre-training with Risk-integrated Image-Metadata Alignment for Medical Diagnosis via LLM

    Feb 26, 2026Yiqing Wang, Chunming He, Ming-Chen Lu +4Cross-Modal AlignmentMultimodal Pretraining

  26. Xray-Visual Models: Scaling Vision models on Industry Scale Data

    Feb 18, 2026Shlok Mishra, Tsung-Yu Lin, Linda Wang +24Vision Foundation ModelsMultimodal Pretraining

  27. PrismSSL: One Interface, Many Modalities; A Single-Interface Library for Multimodal Self-Supervised Learning

    Nov 21, 2025Melika Shirian, Kianoosh Vadaei, Kian Majlessi +3Self-Supervised LearningMultimodal Learning

  28. Theoretical Refinement of CLIP by Utilizing Linear Structure of Optimal Similarity

    Oct 17, 2025Naoki Yoshida, Satoshi Hayakawa, Yuhta Takida +3Cross-Modal LearningKernel Mean Embeddings