Multimodal Contrastive Learning

Latest papers 153

All topics
CardsList
  1. When Modalities Fail to Tango: Conformal Backdoor Detection in Multimodal Contrastive Learning

    Aug 4, 2026Yiming Chen, Kemou Li, Haiwei Wu +1Backdoor DetectionMultimodal Contrastive Learning

  2. Bayesian Data Reweighting Improves Multimodal Retrieval for Knowledge-Based Visual Question Answering

    Aug 3, 2026Jingchen Sun, Shaobo Han, Ruiyi Zhang +5Multimodal IRContrastive Learning

  3. Douyin Multimodal Embedding Model Technical Report

    Aug 3, 2026Haonan Chen, Chu Li, Zhicheng Wang +4Multimodal IRMultimodal Pretraining

  4. Logographic Character Visual Pretraining via Semantic-based Contrastive Learning

    Jul 30, 2026Daqian Shi, Wei Cao, Xiaoyu Zheng +3Contrastive LearningVisual Representation Learning

  5. SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation

    Jul 29, 2026Yunzhan Fu, Enyu Bao, Xiangyu Shen +4Radiology VLMsMedical VLMs

  6. EchoBridge: Long-Tail-Aware ECG-Echocardiography Text Alignment for Echocardiography-Derived Cardiac Findings

    Jul 27, 2026Xiaocheng Fang, Jieyi Cai, Guangkun Nie +9Long-Tailed ClassificationCross-Modal Alignment

  7. TextSLIP: Text Self-Supervised CLIP for Medical Report Generation

    Jul 24, 2026Haoyu Jiang, Ziping CongRadiology Report GenerationSelf-Supervised Learning

  8. Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval

    Jul 23, 2026Kyeongmo Chae, Jihoon Lee, Sangtae AhnRepresentation LearningCross-Modal Alignment

  9. Not All Patches are Equal: Sampling Matters for Visible-Infrared Pre-Training

    Jul 22, 2026Qiwei Ma, Bin Deng, Junjie Zhu +5Visual Representation LearningSelf-Supervised Pre-Training

  10. Beyond Objective Expressivity: Geometry Preservation in Multimodal Contrastive Learning

    Jul 20, 2026Tillmann Rheude, Roland Eils, Benjamin WildGeometric Representation LearningMultimodal Contrastive Learning

  11. MIME: Multimodal Interactive Motion Encoder

    Jul 18, 2026Addison Zucek, Prerit Gupta, Kamila Kuatova +1Text-to-Motion GenerationCross-Modal Alignment

  12. Knowledge-Guided Cross-Modal Fusion for Adult-to-Pediatric ECG Transfer via Label-Conditioned Contrastive Alignment

    Jul 17, 2026Xinran Liu, Yuwen Li, Hongxiang Gao +4ElectrocardiographyCross-Modal Alignment

  13. Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification

    Jul 17, 2026Zhengbo Zhou, Jiren Li, Dooman Arefan +2Radiology VLMsVision-Language Models

  14. Multimodal Semantic-Aware Contrastive Learning For False Negative Mitigation in 3D Medical Imaging

    Jul 16, 2026Sara Ketabi, Matthias W. Wagner, Cynthia Hawkins +3Contrastive Learning3D Medical Imaging

  15. AspectCLIP: Optimizing CLIP Representation Space via Aspect-Guided Consistency Regularization

    Jul 15, 2026Yiyang Yao, Shanglin Liu, Jianming Lv +4Vision-Language AlignmentMultimodal Contrastive Learning

  16. Learning Anatomy-Grounded CT Vision-Language Representations with Organ-Hierarchical Report Knowledge

    Jul 12, 2026Guoliang You, Hongming Li, Yuanwang Zhang +1Radiology VLMsMedical VLMs

  17. On the modality gap and the contrastive loss in multi-modal representation learning

    Jul 12, 2026Fabian Mager, Hiba Nassar, Lars Kai HansenCross-Modal AlignmentMultimodal Contrastive Learning

  18. Local Multimodal Music Alignment from Global Supervision

    Jul 10, 2026Irmak Bukey, Zachary Novack, Jongmin Jung +2Cross-Modal AlignmentCross-Modal Retrieval

  19. MatBind: A Shared Embedding Space for Multimodal Materials Characterization

    Jul 9, 2026Le Yang, Anoop K. Chandran, Jona Östreicher +8Cross-Modal AlignmentMultimodal Embedding

  20. Time Imprint: Learning Time-Aware Representations in Multi-Modal Knowledge Graphs

    Jul 8, 2026Pengyu Zhang, Klim Zaporojets, Congfeng Cao +2Multimodal Graph LearningMultimodal Contrastive Learning

  21. MonoIR-RS: Infrared Remote Sensing Vision-Language Learning with CLIP and VLM Adaptation

    Jul 7, 2026Jiaju Han, Ma Yaqi, Yahui Chai +8Remote Sensing Image UnderstandingVLM Adaptation

  22. CMDR: Contextual Multimodal Document Retrieval

    Jul 7, 2026Ryota Tanaka, Taku Hasegawa, Kyosuke NishidaMultimodal IRMultimodal Embedding

  23. KinEMbed: Decoding Kinematics from Electromyography via Cross-Modal Contrastive Learning

    Jul 6, 2026Sofia Gilardini, Chenfei Ma, Kianoush NazarpourCross-Modal Representation LearningMultimodal Contrastive Learning

  24. Omni-Sleep: A Sleep Foundation Model via Hierarchical Contrastive Learning of CNS-ANS Dynamics

    Jul 4, 2026Zhoujie Hou, Song Wang, Kexin Lou +3Sleep Stage ClassificationLatent Dynamics Modeling

  25. C3C^3ASD: Multi-Level Consistency-Driven Representation Learning

    Jul 3, 2026Jin Hong, Jisoo Park, Junseok KwonMultimodal RobustnessAudio-Visual Representation Learning

  26. Attribute-Prompted Kernel Hashing for Unsupervised Data-Efficient Cross-Modal Retrieval

    Jul 1, 2026Runhao Li, Xiaoxu Ma, Zhenyu Weng +5Cross-Modal AlignmentCross-Modal Retrieval