Multimodal Pretraining

Latest papers 121

All topics
CardsList
  1. SAREO-FM: Decoupled Semantic Supervision for SAR-EO Foundation Models

    Oct 7, 2026Jeonghyeok Do, Munchurl KimRemote Sensing Image UnderstandingMultimodal Pretraining

  2. Multimodal Flow: Unified Flow Modeling of Language and Vision in Embedding Spaces

    Sep 30, 2026Hongyuan Tao, Xinggang Wang, Lianghui Zhu +7Unified Multimodal ModelsMultimodal Pretraining

  3. Advancing Video-Text Pretraining with Multi-View Captions

    Sep 28, 2026Fida M. Thoker, Renaud Vandeghen, Karen Sanchez +2Multimodal Pretraining

  4. InfiMed2: A Generalist Medical Multimodal Foundation Model from Contextual Evidence and Stability-Aware Supervision

    Sep 28, 2026Guanghao Zhu, Zeyu Liu, Zhitian Hou +9Multimodal PretrainingMultimodal QA

  5. Clinical Trajectory Alignment for Medical Vision-Language Pre-training

    Sep 28, 2026Huimin Yan, Xian Yang, Zhi Wang +1Multimodal PretrainingLongitudinal Medical Image Analysis

  6. WB-WAM: Heterogeneous Body-Hand Pre-training for Humanoid Loco-Manipulation

    Sep 28, 2026Chuan Qin, Shaoting Zhu, Siyuan Luo +4Humanoid Loco-ManipulationMultimodal Pretraining

  7. PPG-LM: A Photoplethysmography-Language Model with Multi-Level Clinical Alignment

    Sep 27, 2026Xiaoda Wang, Minxiao Wang, Maxwell A Xu +10Multimodal PretrainingPhotoplethysmography

  8. TimeBraid: Unifying Time Series and Language for Understanding and Forecasting

    Sep 24, 2026Xinyue Wang, Jiacheng Pang, Kun Zhou +7Unified Multimodal ModelsMultimodal Pretraining

  9. PhyMo: A Physical-Field Modality for Multimodal AI4Physics

    Sep 23, 2026Henan Sun, Haitao Hu, Jin Liu +4AI for ScienceCross-Modal Representation Learning

  10. MMAP: Multimodal Missing-Aware Pretraining for Longitudinal Alzheimer's Prediction

    Sep 22, 2026Fiona Kekwick, Matthew Baugh, Bernhard Kainz +2Missing-Modality LearningCross-Modal Alignment

  11. Reading the Whole Heart: Latent-Attention Masked Autoencoders for Multimodal Cardiac Representation Learning

    Sep 10, 2026Andrea Agostini, Simon Böhi, Moritz Vandenhirtz +7Masked AutoencodersHealthcare

  12. Studying Image Tokenizers as Visual Languages in Unified Multimodal Models

    Sep 8, 2026Siting Li, Zhengyang Wang, Simon Shaolei Du +2Image TokenizationUnified Multimodal Models

  13. OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining

    Sep 7, 2026Yuran Wang, Siqiao Huang, Mingleyang Li +21World Model LearningWorld Models for Robotics

  14. MEOX: Compact Multimodal Mixture-of-Experts for Earth Observation

    Sep 4, 2026Mohanad AlbughdadiMasked AutoencodersGeospatial Representation Learning

  15. Exploring the Potential of Contrastive Language-Image Pre-training for Multi-Source Remote Sensing Data

    Sep 3, 2026Xiangyang Miao, Kelu Yao, Yekai Huang +7Remote Sensing Image UnderstandingMultimodal Pretraining

  16. GAAT: Geometry-Aware Alignment Transformer for Multimodal UAV Perception

    Aug 28, 2026Jingpu Yang, Debin Tang, Yilin Sun +4Cross-Modal AlignmentMultimodal Pretraining

  17. Mol-JEPA: A multimodal Joint Embedding Predictive Architecture for Molecules

    Aug 23, 2026Florian Rottach, Sebastian Schieferdecker, William Rudman +2Joint-Embedding Predictive ArchitectureMultimodal Pretraining

  18. Fusion Anything: A Generalized Multimodal Foundation Model

    Aug 16, 2026Huizi Cui, Zongbo Han, Chenggong Ding +6Unified Multimodal ModelsMultimodal Pretraining

  19. MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

    Aug 11, 2026Changhao Xiang, Shangyu Xing, Zhen Wu +2Multimodal GroundingMultimodal Pretraining

  20. Unlocking the Power of Medical Tabular Data via Semantic-Aware Multimodal Pre-training

    Aug 11, 2026Yingsheng Liu, Haiming Li, Jingmin Zhu +6Cross-Modal Representation LearningMultimodal Pretraining

  21. SLED: Scalable Location Encoding via Distillation

    Aug 6, 2026Kevin Lane, Zhongying Wang, Esther Rolf +1Geospatial Representation LearningMultimodal Pretraining

  22. Is Self-Pretraining really useful to improve diagnosis in medical Time Series?

    Aug 6, 2026Omar Coser, Antonio Orvieto, Paolo Soda +1Time Series ClassificationSelf-Supervised Time Series Representation Learning

  23. SciQNet: Two-Stage Multimodal Adaptation for Scientific Image Quality Assessment

    Aug 6, 2026Yin-Loon Khor, Yi-Jie Wong, Jing Jie Tan +1VLM AdaptationMultimodal Pretraining