Cross-Modal Retrieval

Latest papers 134

All topics
CardsList
  1. SIMMER: Cross-Modal Food Image--Recipe Retrieval via MLLM-Based Embedding

    Apr 17, 2026Keisuke Gomi, Keiji YanaiCross-Modal LearningImage-Text Retrieval

  2. MG2^2-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation

    Apr 4, 2026Sijun Dai, Qiang Huang, Xiaoxing You +1Cross-Modal LearningMultimodal RAG

  3. FusionBERT: Multi-View Image--3D Retrieval via Cross-Attention Visual Fusion and Normal-Aware 3D Encoder

    Apr 2, 2026Wei Li, Yufan Ren, Hanqing Jiang +6Multi-View LearningCross-Modal Retrieval

  4. Fine-grained Motion Retrieval via Joint-Angle Motion Images and Token-Patch Late Interaction

    Mar 10, 2026Yao Zhang, Zhuchenyang Liu, Yanlan He +2Representation LearningFeature Interaction Modeling

  5. SleepLM: Natural-Language Intelligence for Human Sleep

    Feb 27, 2026Zongzhe Xu, Zitao Shuai, Eideen Mozaffari +3Multimodal PretrainingCross-Modal Retrieval

  6. Generating a Paracosm for Training-Free Zero-Shot Composed Image Retrieval

    Jan 31, 2026Tong Wang, Yunhan Zhao, Shu KongImage MatchingCross-Modal Retrieval

  7. ShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web Search

    Jan 30, 2026Tao Yu, Haopeng Jin, Hao Wang +19Temporal Video GroundingCross-Modal Retrieval

  8. VLM2GeoVec: Toward Universal Multimodal Embeddings for Remote Sensing

    Dec 12, 2025Emanuel Sánchez Aimar, Gulnaz Zhambulova, Fahad Shahbaz Khan +2Cross-Modal LearningMultimodal Embedding

  9. GeoBridge++: Fact-Guided Geo-Semantic Bridging for Unified Cross-View Geo-Localization

    Dec 2, 2025Zixuan Song, Jing Zhang, Di Wang +6Cross-View Geo-LocalizationGeospatial Representation Learning

  10. MCA: Modality Composition Awareness for Robust Composed Multimodal Retrieval

    Oct 17, 2025Qiyu Wu, Shuyang Cui, Satoshi Hayakawa +3Multimodal RobustnessMultimodal Large Language Models

  11. Theoretical Refinement of CLIP by Utilizing Linear Structure of Optimal Similarity

    Oct 17, 2025Naoki Yoshida, Satoshi Hayakawa, Yuhta Takida +3Cross-Modal LearningKernel Mean Embeddings

  12. TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval

    Oct 11, 2025Zixu Zhao, Yang Zhan, Yunhao Li +1Cross-Modal RetrievalVision-Language Alignment

  13. Multimodal Representation Alignment for Cross-modal Information Retrieval

    Jun 10, 2025Fan Xu, Luis A. LeivaCross-Modal LearningMultimodal IR