Cross-Modal Learning

Latest papers 127

All topics
CardsList
  1. Context Unrolling in Omni Models

    Apr 23, 2026Ceyuan Yang, Zhijie Lin, Yang Zhao +16Cross-Modal LearningUnified Multimodal Models

  2. MiMIC: Mitigating Visual Modality Collapse in Universal Multimodal Retrieval While Avoiding Semantic Misalignment

    Apr 23, 2026Juan Li, Chuanghao Ding, Xujie Zhang +1Cross-Modal LearningCross-Modal Alignment

  3. UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval

    Apr 22, 2026Haokun Wen, Xuemeng Song, Haoyu Zhang +3Cross-Modal LearningLearning to Rank

  4. DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning

    Apr 20, 2026Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao +3Cross-Modal LearningVisual Question Answering

  5. Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale

    Apr 20, 2026A. Sophia Koepke, Daniil Zverev, Shiry Ginosar +1Cross-Modal LearningCross-Modal Representation Learning

  6. ReTrack: Evidence-Driven Dual-Stream Directional Anchor Calibration Network for Composed Video Retrieval

    Apr 20, 2026Zixu Li, Yupeng Hu, Zhiwei Chen +4Cross-Modal LearningCross-Modal Representation Learning

  7. BioVLM: Routing Prompts, Not Parameters, for Cross-Modality Generalization in Biomedical VLMs

    Apr 19, 2026Mainak Singha, Tanisha Gupta, Ankit Jha +3Cross-Modal LearningPrompt Learning

  8. Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability

    Apr 19, 2026Lijie ZhouCross-Modal LearningVLM Robustness

  9. Better with Less: Tackling Heterogeneous Multi-Modal Image Joint Pretraining via Conditioned and Degraded Masked Autoencoder

    Apr 18, 2026Bowen Peng, Yongxiang Liu, Jie Zhou +4Cross-Modal LearningMasked Autoencoders

  10. PivotMerge: Bridging Heterogeneous Multimodal Pre-training via Post-Alignment Model Merging

    Apr 18, 2026Zibo Shao, Baochen Xiong, Xiaoshan Yang +4Cross-Modal LearningCross-Modal Alignment

  11. CrossFlowDG: Bridging the Modality Gap with Cross-modal Flow Matching for Domain Generalization

    Apr 18, 2026Antonios Kritikos, Nikolaos Spanos, Athanasios VoulodimosCross-Modal LearningCross-Modal Alignment

  12. Channel Attention-Guided Cross-Modal Knowledge Distillation for Referring Image Segmentation

    Apr 18, 2026Chen YangCross-Modal LearningCross-Modal Knowledge Distillation

  13. AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers

    Apr 17, 2026Edson Araujo, Saurabhchand Bhati, M. Jehanzeb Mirza +5Cross-Modal LearningAudio-Visual Understanding

  14. Joint-Centric Dual Contrastive Alignment with Structure-Preserving and Information-Balanced Regularization

    Apr 17, 2026Habibeh Naderi, Behrouz Haji Soleimani, Stan MatwinCross-Modal LearningModality Imbalance

  15. SIMMER: Cross-Modal Food Image--Recipe Retrieval via MLLM-Based Embedding

    Apr 17, 2026Keisuke Gomi, Keiji YanaiCross-Modal LearningImage-Text Retrieval

  16. MG2^2-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation

    Apr 4, 2026Sijun Dai, Qiang Huang, Xiaoxing You +1Cross-Modal LearningMultimodal RAG

  17. CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks

    Apr 1, 2026Wish Suharitdamrong, Tony Alex, Muhammad Awais +1Cross-Modal LearningVLM Adaptation

  18. UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation

    Mar 23, 2026Ziyi Wang, Xinshun Wang, Shuang Chen +2Cross-Modal LearningUnified Multimodal Models

  19. ITO: Multi-View Alignment and Training-Time Fusion for Image-Text Pretraining

    Mar 3, 2026Hanpeng Liu, Zidan Wang, Shuoxi Zhang +6Cross-Modal LearningCross-Modal Alignment

  20. SOTAlign: Semi-Supervised Alignment of Unimodal Vision and Language Models via Optimal Transport

    Feb 26, 2026Simon Roschmann, Paul Krzakala, Sonia Mazelet +2Cross-Modal LearningMultimodal Embedding

  21. MMLoP: Multi-Modal Low-Rank Prompting for Efficient Vision-Language Adaptation

    Feb 24, 2026Sajjad Ghiasvand, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh +1Cross-Modal LearningPrompt Learning

  22. Audio-Visual Continual Test-Time Adaptation without Forgetting

    Feb 20, 2026Sarthak Kumar Maharana, Akshay Mehra, Bhavya Ramakrishna +2Cross-Modal LearningSource-Free Domain Adaptation

  23. SpectralGCD: Spectral Concept Selection and Cross-modal Representation Learning for Generalized Category Discovery

    Feb 19, 2026Lorenzo Caselli, Marco Mistretta, Simone Magistri +1Cross-Modal LearningCross-Modal Representation Learning

  24. The Geometric Mechanics of Contrastive Representation Learning: Alignment Potentials, Entropic Dispersion, and Cross-modal Divergence

    Jan 27, 2026Yichao Cai, Zhen Zhang, Yuhang Liu +1Cross-Modal LearningContrastive Learning

  25. CLIMP: Contrastive Language-Image Mamba Pretraining

    Jan 11, 2026Nimrod Shabtay, Itamar Zimerman, Eli Schwartz +1Cross-Modal LearningVLM Robustness

  26. VLM2GeoVec: Toward Universal Multimodal Embeddings for Remote Sensing

    Dec 12, 2025Emanuel Sánchez Aimar, Gulnaz Zhambulova, Fahad Shahbaz Khan +2Cross-Modal LearningMultimodal Embedding

  27. Theoretical Refinement of CLIP by Utilizing Linear Structure of Optimal Similarity

    Oct 17, 2025Naoki Yoshida, Satoshi Hayakawa, Yuhta Takida +3Cross-Modal LearningKernel Mean Embeddings

  28. FairSSL: Fair Multimodal Self-Supervised Learning

    Aug 22, 2025Jiaee Cheong, Abtin Mogharabin, Paul Liang +2Cross-Modal LearningRepresentation Learning

  29. Inverse-LLaVA: Rethinking Multimodal Alignment via Text-to-Vision Mapping

    Aug 17, 2025Xuhui Zhan, Tyler DerrCross-Modal LearningCross-Modal Representation Learning