Cross-Modal Learning

Latest papers 127

All topics
CardsList
  1. Multimodal Distribution Matching for Vision-Language Dataset Distillation

    May 22, 2026Jongoh Jeong, Hoyong Kwon, Minseok Kim +1Cross-Modal LearningCross-Modal Alignment

  2. Inconsistency-aware Multimodal Schrödinger Bridge for Deepfake Localization

    May 22, 2026Jiayu Xiong, Jing Wang, Qi Zhang +2Cross-Modal LearningMultimodal Robustness

  3. Supervised Classification Heads as Semantic Prototypes: Unlocking Vision-Language Alignment via Weight Recycling

    May 21, 2026David Méndez, Roberto Confalonieri, Natalia Díaz RodríguezCross-Modal LearningVLM Adaptation

  4. LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

    May 21, 2026Yifan Dai, Zhenhua Wu, Bohan Zeng +18Cross-Modal LearningAudio-Visual Understanding

  5. STiTch: Semantic Transition and Transportation in Collaboration for Training-Free Zero-Shot Composed Image Retrieval

    May 20, 2026Miaoge Li, Dongsheng Wang, Zening Sun +3Cross-Modal LearningCross-Modal Alignment

  6. Multimodal LLMs under Pairwise Modalities

    May 20, 2026Yan Li, Yunlong Deng, Yuewen Sun +3Cross-Modal LearningRepresentation Identifiability

  7. LLM Pretraining Shapes a Generalizable Manifold: Insights into Cross-Modal Transfer to Time Series

    May 19, 2026Alexis Roger, Prateek Humane, Zhenghan Tai +4Cross-Modal LearningLanguage Model Pretraining

  8. MetaEarth-MM: Unified Multimodal Remote Sensing Image Generation with Scene-centered Joint Modeling

    May 19, 2026Zhiping Yu, Chenyang Liu, Jinqi Cao +4Cross-Modal LearningUnified Multimodal Models

  9. AffectVerse: Emotional World Models for Multimodal Affective Computing

    May 19, 2026Bo Zhao, Fanghua Ye, Yixin Ji +3Cross-Modal LearningMultimodal Large Language Models

  10. Fine-tuning language encoding models on slow fMRI improves prediction for fast ECoG

    May 19, 2026Aditya R. Vaidya, Richard J. Antonello, Alexander G. HuthCross-Modal LearningTransfer Learning

  11. Chronicle: A Multimodal Foundation Model for Joint Language and Time Series Understanding

    May 18, 2026Paul Quinlan, Jeremy Levasseur, Qingguo Li +1Cross-Modal LearningMultivariate Time Series Forecasting

  12. Weakly Supervised Cross-Modal Learning for 4D Radar Scene Flow Estimation

    May 18, 2026Jingyun Fu, Zhiyu Xiang, Na ZhaoCross-Modal LearningAutonomous Driving Perception

  13. See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding

    May 18, 2026Boyuan Sun, Bowen Yin, Yuanming Li +2Cross-Modal LearningVideo Object Segmentation

  14. LatentUMM: Dual Latent Alignment for Unified Multimodal Models

    May 18, 2026Yinyi Luo, Wenwen Wang, Hayes Bai +2Cross-Modal LearningUnified Multimodal Models

  15. t-gems: text-guided exit modules for decreasing clip image encoder

    May 17, 2026Alberto Presta, Grzegorz Stefanski, Michal Byra +1Cross-Modal LearningVision-Language Models

  16. Mind the Gap: Learning Modality-Agnostic Representations with a Cross-Modality UNet

    May 16, 2026Xin Niu, Enyi Li, Jinchao Liu +3Cross-Modal LearningCross-Modal Representation Learning

  17. Cross-modal Affinity-aligned Multimodal Learning Analytics for Predicting Student Collaboration Satisfaction in Game-Based Learning

    May 16, 2026Wen-Hsin Tsai, Chia-Ming Lee, Yuk-Ying TungCross-Modal LearningMultimodal Robustness

  18. GOMA: Toward Structure-Driven Multimodal Alignment from a Graph Signal Smoothing Perspective

    May 15, 2026Xu Wang, Xunkai Li, Yinlin Zhu +2Cross-Modal LearningMultimodal IR

  19. Differentially Private Motif-Preserving Multi-modal Hashing

    May 14, 2026Zehua Cheng, Wei Dai, Jiahao SunCross-Modal LearningCross-Modal Retrieval

  20. GeoFlowVLM: Geometry-Aware Joint Uncertainty for Frozen Vision-Language Embedding

    May 13, 2026Mayank Nautiyal, Li Ju, Andreas Hellander +2Cross-Modal LearningFlow Matching

  21. SMA: Submodular Modality Aligner For Data Efficient Multimodal Learning

    May 13, 2026Truong Pham, Anay Majee, Rishabh IyerCross-Modal LearningCross-Modal Alignment

  22. SynIB: Informational Bottleneck for Maximizing Synergy in Multimodal Learning

    May 12, 2026Konstantinos Kontras, Teodora Gagaleska, Thomas Strypsteen +4Cross-Modal LearningMultimodal Learning

  23. Cross-Modal-Domain Generalization Through Semantically Aligned Discrete Representations

    May 12, 2026Souptik Sen, Raneen Younis, Zahra AhmadiCross-Modal LearningRepresentation Learning

  24. Probing Cross-modal Information Hubs in Audio-Visual LLMs

    May 11, 2026Jihoo Jung, Chaeyoung Jung, Ji-Hoon Kim +1Cross-Modal LearningMultimodal Large Language Models

  25. Dynamic Cross-Modal Prompt Generation for Multimodal Continual Instruction Tuning

    May 11, 2026Tao Hu, Da-Wei ZhouCross-Modal LearningContinual Learning for LLMs