Multimodal Pretraining

Latest papers 121

All topics
CardsList
  1. BioMatrix: Towards a Comprehensive Biological Foundation Model Spanning the Modality Matrix of Sequences, Structures, and Language

    Jun 20, 2026Qizhi Pei, Zhimeng Zhou, Yi Duan +9Unified Multimodal ModelsMultimodal Pretraining

  2. MixProLAP: Mixture-Induced Uncertainty Modeling for Probabilistic Language-Audio Pretraining

    Jun 18, 2026Yu Nakagome, Jaesong Lee, Soo-Whan ChungMultimodal PretrainingAudio-Language Models

  3. Multi-Modal Contrastive Learning for Implicit Earth Embeddings via Location Tying

    Jun 18, 2026Jonathan Hecht, Lukas Arzoumanidis, Ziyue Li +1Self-Supervised Pre-TrainingGeospatial Representation Learning

  4. Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model

    Jun 16, 2026Jinghan Wu, Jing Li, Ivor W. Tsang +1Coreference ResolutionVLM Adaptation

  5. See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL

    Jun 16, 2026Yilian Liu, Sicong Leng, Guoshun Nan +7Multimodal PretrainingVisually Grounded Reasoning

  6. FusionRS: A Large-Scale RGB-Infrared Remote Sensing Dataset for Dual-Modal Vision-Language Foundation Models

    Jun 15, 2026Jiaju Han, Ben Zhang, Xuemeng Sun +6Remote Sensing Image UnderstandingMultimodal Pretraining

  7. CAP: Towards PPG Universal Representation Learning with Patient-level Supervision

    Jun 13, 2026Chenyang He, Xinyi Shao, Shun Huang +4Representation LearningCross-Modal Representation Learning

  8. Learning Sparse Latent Predictive Foundation Model for Multimodal Neuroimaging

    Jun 12, 2026Haoxu Huang, Long Chen, Jingyun Chen +8Medical Imaging Foundation ModelsJoint-Embedding Predictive Architecture

  9. GLACIER: A Multimodal Student-Teacher Foundation Model for Molecular Property Prediction

    Jun 9, 2026Emily Nguyen, Yongchan Hong, Harsh Toshniwal +2Multimodal PretrainingMolecular Property Prediction

  10. Next-Token Prediction Learns Generalisable Representations of Sleep Physiology

    Jun 8, 2026Jonathan F. Carter, Lionel TarassenkoSleep Stage ClassificationTime Series Classification

  11. CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning

    Jun 8, 2026Penghui Yang, Long Xing, Xiaoyi Dong +10Image CaptioningMultimodal Pretraining

  12. A robust PPG foundation model using multimodal physiological supervision

    Jun 5, 2026Eloy Geenjaar, Vince Calhoun, Scott Daly +4Multimodal RobustnessMultimodal Pretraining

  13. BRepCLIP: Contrastive Multimodal Pretraining on BRep Primitives for CAD Understanding

    Jun 3, 2026Muhammad Usama, Didier Stricker, Mohammad Sadil Khan +1Multimodal PretrainingMultimodal Contrastive Learning

  14. Beyond Captions: Context-Grounded Reconstruction for Biomedical Multimodal Continued Pretraining

    May 31, 2026Guanghao Zhu, Zeyu Liu, Zhitian Hou +10Vision-Language ModelsMultimodal Pretraining

  15. UniRTL: Unifying Code and Graph for Robust RTL Representation Learning

    May 29, 2026Yi Liu, Hongji Zhang, Lei Chen +2Representation LearningCross-Modal Representation Learning

  16. DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation

    May 28, 2026Jusuk Lee, Seungjae Lee, Jonghun Shin +6Cross-Modal LearningCross-Modal Representation Learning

  17. Archon: A Unified Multimodal Model for Holistic Digital Human Generation

    May 28, 2026Chong Bao, Shichen Liu, Lijun Yu +9Unified Multimodal ModelsMultimodal Pretraining

  18. VLMs May Not Globally Enhance Human Alignment over LLMs During Natural Reading

    May 27, 2026Jinzhou Wu, Zhengwu Ma, Jixing Li +2VLM EvaluationVision-Language Models

  19. FLORO: A Multimodal Geospatial Foundation Model for Ecological Remote Sensing Across Sensors and Scales

    May 27, 2026Jorge L. Rodriguez, Victor Angulo Morales, Areej Alwahas +6Remote Sensing Image SegmentationGeospatial Foundation Models

  20. FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling

    May 26, 2026Guixian Xu, Yide Liang, Zeli Su +5VLM EvaluationVision-Language Models

  21. Semantics-Guided Multimodal Masked Autoencoder Pretraining for 3D BEV Object Detection

    May 24, 2026Prabuddhi Wariyapperuma, Rajitha de Silva, Marc Hanheide +2Lidar-Based 3D Object DetectionMasked Autoencoders

  22. SLIP-RS: Structured-Attribute Language-Image Pre-Training for Remote Sensing Object Detection

    May 22, 2026Chenxu Wang, Yuxuan Li, Yunheng Li +3Open-Vocabulary Object DetectionRemote Sensing Image Understanding

  23. Learning Emergent Modular Representations in Multi-modality Medical Vision Foundation Models

    May 21, 2026Yuting He, Chenyu You, Shuo LiMedical Imaging Foundation ModelsMultimodal Pretraining

  24. An Open Multi-Center Whole-Body FDG PET/CT Foundation Model for Tumor Segmentation

    May 20, 2026Xiaofeng Liu, Qianru Zhang, Thibault Marin +4Cross-Modality Medical Image SegmentationMedical Imaging Foundation Models

  25. SpectralEarth-FM: Bringing Hyperspectral Imagery into Multimodal Earth Observation Pretraining

    May 20, 2026Nassim Ait Ali Braham, Aaron Banze, Conrad M. Albrecht +3Geospatial Foundation ModelsMultimodal Pretraining

  26. Chronicle: A Multimodal Foundation Model for Joint Language and Time Series Understanding

    May 18, 2026Paul Quinlan, Jeremy Levasseur, Qingguo Li +1Cross-Modal LearningMultivariate Time Series Forecasting

  27. ITGPT: Generative Pretraining on Irregular Timeseries

    May 15, 2026Antoine Honoré, Ming XiaoIrregular Time-Series ModelingSelf-Supervised Time Series Representation Learning

  28. GeoViSTA: Geospatial Vision-Tabular Transformer for Multimodal Environment Representation

    May 14, 2026Yuhao Liu, Sadeer Al-Kindi, Ashok Veeraraghavan +1Geospatial Foundation ModelsGeospatial Representation Learning