Multimodal Pretraining

Latest papers 119

All topics
CardsList
  1. Multimodal Flow: Unified Flow Modeling of Language and Vision in Embedding Spaces

    Sep 30, 2026Hongyuan Tao, Xinggang Wang, Lianghui Zhu +7Unified Multimodal ModelsMultimodal Pretraining

  2. Advancing Video-Text Pretraining with Multi-View Captions

    Sep 28, 2026Fida M. Thoker, Renaud Vandeghen, Karen Sanchez +2Multimodal Pretraining

  3. InfiMed2: A Generalist Medical Multimodal Foundation Model from Contextual Evidence and Stability-Aware Supervision

    Sep 28, 2026Guanghao Zhu, Zeyu Liu, Zhitian Hou +9Multimodal PretrainingMultimodal QA

  4. Clinical Trajectory Alignment for Medical Vision-Language Pre-training

    Sep 28, 2026Huimin Yan, Xian Yang, Zhi Wang +1Multimodal PretrainingLongitudinal Medical Image Analysis

  5. WB-WAM: Heterogeneous Body-Hand Pre-training for Humanoid Loco-Manipulation

    Sep 28, 2026Chuan Qin, Shaoting Zhu, Siyuan Luo +4Humanoid Loco-ManipulationMultimodal Pretraining

  6. PPG-LM: A Photoplethysmography-Language Model with Multi-Level Clinical Alignment

    Sep 27, 2026Xiaoda Wang, Minxiao Wang, Maxwell A Xu +10Multimodal PretrainingPhotoplethysmography

  7. TimeBraid: Unifying Time Series and Language for Understanding and Forecasting

    Sep 24, 2026Xinyue Wang, Jiacheng Pang, Kun Zhou +7Unified Multimodal ModelsMultimodal Pretraining

  8. PhyMo: A Physical-Field Modality for Multimodal AI4Physics

    Sep 23, 2026Henan Sun, Haitao Hu, Jin Liu +4AI for ScienceCross-Modal Representation Learning

  9. MMAP: Multimodal Missing-Aware Pretraining for Longitudinal Alzheimer's Prediction

    Sep 22, 2026Fiona Kekwick, Matthew Baugh, Bernhard Kainz +2Missing-Modality LearningCross-Modal Alignment

  10. Reading the Whole Heart: Latent-Attention Masked Autoencoders for Multimodal Cardiac Representation Learning

    Sep 14, 2026Andrea Agostini, Simon Böhi, Moritz Vandenhirtz +7Masked AutoencodersHealthcare

  11. Studying Image Tokenizers as Visual Languages in Unified Multimodal Models

    Sep 8, 2026Siting Li, Zhengyang Wang, Simon Shaolei Du +2Image TokenizationUnified Multimodal Models

  12. OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining

    Sep 7, 2026Yuran Wang, Siqiao Huang, Mingleyang Li +21World Model LearningWorld Models for Robotics

  13. MEOX: Compact Multimodal Mixture-of-Experts for Earth Observation

    Sep 4, 2026Mohanad AlbughdadiMasked AutoencodersGeospatial Representation Learning

  14. Exploring the Potential of Contrastive Language-Image Pre-training for Multi-Source Remote Sensing Data

    Sep 3, 2026Xiangyang Miao, Kelu Yao, Yekai Huang +7Remote Sensing Image UnderstandingMultimodal Pretraining

  15. GAAT: Geometry-Aware Alignment Transformer for Multimodal UAV Perception

    Aug 28, 2026Jingpu Yang, Debin Tang, Yilin Sun +4Cross-Modal AlignmentMultimodal Pretraining

  16. Mol-JEPA: A multimodal Joint Embedding Predictive Architecture for Molecules

    Aug 23, 2026Florian Rottach, Sebastian Schieferdecker, William Rudman +2Joint-Embedding Predictive ArchitectureMultimodal Pretraining

  17. Fusion Anything: A Generalized Multimodal Foundation Model

    Aug 16, 2026Huizi Cui, Zongbo Han, Chenggong Ding +6Unified Multimodal ModelsMultimodal Pretraining

  18. MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

    Aug 11, 2026Changhao Xiang, Shangyu Xing, Zhen Wu +2Multimodal GroundingMultimodal Pretraining

  19. Unlocking the Power of Medical Tabular Data via Semantic-Aware Multimodal Pre-training

    Aug 11, 2026Yingsheng Liu, Haiming Li, Jingmin Zhu +6Cross-Modal Representation LearningMultimodal Pretraining

  20. SLED: Scalable Location Encoding via Distillation

    Aug 6, 2026Kevin Lane, Zhongying Wang, Esther Rolf +1Geospatial Representation LearningMultimodal Pretraining

  21. Is Self-Pretraining really useful to improve diagnosis in medical Time Series?

    Aug 6, 2026Omar Coser, Antonio Orvieto, Paolo Soda +1Time Series ClassificationSelf-Supervised Time Series Representation Learning

  22. SciQNet: Two-Stage Multimodal Adaptation for Scientific Image Quality Assessment

    Aug 6, 2026Yin-Loon Khor, Yi-Jie Wong, Jing Jie Tan +1VLM AdaptationMultimodal Pretraining

  23. Decoupling Perception from Description: Computation-Grounded Representation Alignment between Multivariate Time Series and Language

    Aug 5, 2026Xinran Feng, Yi Xie, Chao Zhang +4Cross-Modal Representation LearningMultimodal Pretraining

  24. ReMiX-MAE: Learning Missing-Channel Cross-Modal Representations from RGB-Only Clinical Facial Videos for Sympathetic-Mediated Pain Assessment

    Aug 3, 2026Nan Bi, Taoyue Wang, Lijun Yin +1Missing-Modality LearningMasked Autoencoders

  25. HarMoE: Multi-Source Chest Radiograph Pretraining with Dataset-Disentangled Experts

    Aug 3, 2026Haozhe Luo, Ziyu Zhou, Shelley Zixin Shu +1Multi-Source Domain AdaptationChest X-Ray Classification

  26. Douyin Multimodal Embedding Model Technical Report

    Aug 3, 2026Haonan Chen, Chu Li, Zhicheng Wang +4Multimodal IRMultimodal Pretraining

  27. GALA: Generative Aligned Learning for Adaptive Multimodal Representation in the Taobao Shangou Recommender System

    Jul 31, 2026Jiping Liu, Zhongmin Zhang, Zisen Sang +7Cross-Modal AlignmentMultimodal Pretraining

  28. Data Pyramid for Embodied Manipulation: A Survey

    Jul 27, 2026Yifan Ye, Yankai Fu, Yaoxu Lv +26Robotic Data CollectionRobot Foundation Models

  29. Scaling GUI Agents with Visual State Transitions

    Jul 27, 2026Xiangyan Liu, Kaixin Li, Haonan Wang +6World ModelsGUI Agents

  30. mmSimPrior: Learning Simulation Priors for Data-Efficient and Generalizable Real-World Radar-based Human Motion Reconstruction

    Jul 25, 2026Cheng Guo, Qiming Cao, Shengkai Xu +4Synthetic Data PretrainingSim-to-Real Transfer

  31. LunarFM: A Shared Multimodal Representation of the Moon's Surface

    Jul 24, 2026Marc Girona-Mata, Jakob Gawlikowski, Sumit Goski +6Geospatial Representation LearningMultimodal Pretraining

  32. Scaling Native Multimodal Pre-Training From Scratch

    Jul 24, 2026Haoyuan Wu, Aoqi Wu, Hai Wang +3Cross-Modal LearningMultimodal Pretraining

  33. Multimodal Pretraining for Generalizable EEG Representation Learning

    Jul 23, 2026Targol Bakhtiarvand, Jugal Kalita, Adham AtyabiCross-Subject EEG DecodingElectroencephalography

  34. Antigen-specific Antibody Multi-modal Foundation Model for Functional Antibody Design

    Jul 22, 2026Xiaoliang Shi, Zichen Wang, Runze Ma +2Multimodal PretrainingProtein Design

  35. scMIR: a vision-language foundation model for single-cell light microscopy image representation

    Jul 21, 2026Yifan Shang, Jiahui Tan, Xiangxiang Zeng +1Cross-Modal Representation LearningVisual Representation Learning

  36. Pailitao-MMSearch: Building Native E-Commerce Multimodal Search Foundation

    Jul 20, 2026Xiaohan Ye, Xu Chen, Zihan Gong +15Multimodal IRMultimodal Pretraining

  37. Monkey King Bang: A Unified Scientific Multimodal Foundation Model

    Jul 17, 2026Hesen Chen, Xinyu Su, Xiaomeng Yang +11AI for ScienceUnified Multimodal Models

  38. Toward Federated Multimodal Graph Foundation Models: A Topology-Aware Multimodal Alignment Framework

    Jul 17, 2026Xunkai Li, Guohao Fu, Yuming Ai +4Multimodal Federated LearningCross-Modal Alignment

  39. Video = World + Event Stream

    Jul 16, 2026Lianghua Huang, Zhi-Fan Wu, Yupeng Shi +24Audio-Visual UnderstandingStreaming Video Understanding

  40. Multimodal Semantic-Aware Contrastive Learning For False Negative Mitigation in 3D Medical Imaging

    Jul 16, 2026Sara Ketabi, Matthias W. Wagner, Cynthia Hawkins +3Contrastive Learning3D Medical Imaging

  41. Multimodality as Supervision: Self-Supervised Specialization to the Test Environment via Multimodality

    Jul 16, 2026Kunal Pratap Singh, Ali Garjani, Rishubh Singh +6Cross-Modal LearningCross-Modal Representation Learning

  42. Empowering Long-form Omni-modal Understanding with Robust Audio Perception

    Jul 11, 2026Kaiying Yan, Luoyi Sun, Xiao Zhou +1Audio-Visual UnderstandingMultimodal Pretraining

  43. A Foundation Model for Multimodal Event Sequences in Financial Applications

    Jul 10, 2026Nikita Rusakov, Vladislav Meshkov, Konstantin Zorin +4Financial ServicesMultimodal Pretraining

  44. MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

    Jul 8, 2026Hyunjae Kim, Dain Kim, Pan Xiao +25Medical Imaging Foundation ModelsTraining Data Curation

  45. GaussFusion: Towards Multimodal 3D Gaussian Pretraining

    Jul 7, 2026Zhixuan You, Jihua Zhu, Yiding Sun +53D Gaussian SplattingCross-Modal Representation Learning

  46. Moonstone: A Multimodal Foundation Model and Benchmark for Lunar Remote Sensing

    Jul 3, 2026Ayush Prasad, Swarnalee MazumderMissing-Modality LearningMasked Autoencoders

  47. Rosetta: Composable Native Multimodal Pretraining

    Jul 1, 2026Xiangyue Liu, Zijian Zhang, Miles Yang +3Unified Multimodal ModelsMultimodal Pretraining

  48. Orca: The World is in Your Mind

    Jun 29, 2026Yihao Wang, Yuheng Ji, Mingyu Cao +54World Model LearningMultimodal Pretraining

  49. Heterogeneous Tactile Transformer

    Jun 29, 2026Jianxin Bi, Qiang Wang, Jayaram Reddy +4Representation LearningMultimodal Pretraining

  50. NIVA: A Multimodal Foundation Model for Actionable Earth System Intelligence

    Jun 26, 2026Anisha Pal, Aodhan Sweeney, Kyle Heyblom +1Climate ScienceMultimodal Pretraining

  51. ViQ: Text-Aligned Visual Quantized Representations at Any Resolution

    Jun 25, 2026Xumin Yu, Zuyan Liu, Zhenyu Yang +5Visual Representation LearningMultimodal Pretraining

  52. BioMatrix: Towards a Comprehensive Biological Foundation Model Spanning the Modality Matrix of Sequences, Structures, and Language

    Jun 20, 2026Qizhi Pei, Zhimeng Zhou, Yi Duan +9Unified Multimodal ModelsMultimodal Pretraining