Cross-Modal Retrieval

Latest papers 134

All topics
CardsList
  1. IMAGINE: Adaptive Schema-Imagery Enhanced Composition for Composed Video Retrieval

    Jun 6, 2026Jiale Huang, Zixu Li, Zhiwei Chen +3Cross-Modal AlignmentCross-Modal Retrieval

  2. To Be Multimodal or Not to Be: Query-Adaptive Audio-Visual Person Retrieval via Active Modality Detection

    Jun 4, 2026Erfan Loweimi, Mengjie Qian, Kate Knill +7Missing-Modality LearningAudio-Visual Understanding

  3. UniCA: Bi-directional Cross-Attention with Positive Similarity Loss for Robust Multi-Modal Retrieval

    Jun 3, 2026Yini Huang, Wenlong ZhangMultimodal IRCross-Modal Alignment

  4. Overview of the EReL@MIR 2025 Multimodal Document Retrieval Challenge (Track 1)

    Jun 2, 2026Jingbiao MeiMultimodal IRMultimodal Embedding

  5. Intra-Modal Neighbors Never Lie: Rectifying Inter-Modal Noisy Correspondence via Graph-Based Intra-Modal Reasoning

    Jun 2, 2026Yang Liu, Wentao Feng, Shu-Dong Huang +2Cross-Modal AlignmentCross-Modal Retrieval

  6. Mixed-Modality Dual Face-Hair Retrieval

    Jun 2, 2026Quoc-Anh Bui-Huynh, Mai-Tuyen Lam, Dai-Anh-Tuan Nguyen +1Cross-Modal AlignmentCross-Modal Retrieval

  7. Reason-Then-Retrieve for CoVR-R with Structured Edit Prompts and Dense-Sparse Fusion

    Jun 1, 2026DongQing Liu, MengShi Qi, HongWei JiCross-Modal RetrievalVideo Reasoning

  8. Training-Free Composed Video Retrieval via Visual Representation-Guided Video-LLM Reasoning

    Jun 1, 2026Yang Liu, Qianqian Xu, Peisong Wen +2Cross-Modal RetrievalComposed Video Retrieval

  9. Towards Resolving Optimization Conflicts Between Image- and Text-Based Person Re-Identification

    Jun 1, 2026Karina Kvanchiani, Timur MamedovCross-Modal Representation LearningMulti-Task Learning

  10. R^3: Composed Video Retrieval via Reasoning-Guided Recalling and Re-ranking

    May 31, 2026Zixu Li, Yupeng Hu, Zhiheng Fu +3Cross-Modal RetrievalComposed Video Retrieval

  11. Dual-Route Top-K Retrieval with 1v1 VLM Reranking for the CoVR-R

    May 31, 2026Yuyang Sun, Yongliang Wu, Xingyu Zhu +8Multimodal RerankingCross-Modal Retrieval

  12. CR-JEPA: Cross-Modal Joint-Embedding Predictive Learning for Remote Sensing Image Retrieval

    May 30, 2026Md Aminur Hossain, Ayush V. Patel, Nitant Dube +1Cross-Modal Representation LearningJoint-Embedding Predictive Architecture

  13. T-CLIP: Enabling Thermal Perception for Contrastive Language-Image Pretraining

    May 30, 2026Tayeba Qazi, Ayush Maheshwari, Prerana Mukherjee +1Thermal ImagingImage Captioning

  14. Beyond Classification: Dynamic Adapter Routing for Continual Multimodal Retrieval

    May 29, 2026Alicja Dobrzeniecka, Filip Szatkowski, Sebastian Cygert +2Multimodal IRVLM Adaptation

  15. Variational Adapter for Cross-modal Similarity Representation

    May 29, 2026WenZhang Wei, Zhipeng Gui, Dehua Peng +2Cross-Modal Representation LearningVLM Adaptation

  16. Semantic Motion Anchors: Bridging Motion and Meaning in Co-Speech Gestures

    May 28, 2026Varsha Suresh, Mohammad Mahdi Abootorabi, Mohamed Salman +5Cross-Modal AlignmentHuman Motion Generation

  17. MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models

    May 25, 2026Kaixiang Chen, Pengfei Fang, Hui XueCross-Modal LearningCross-Modal Representation Learning

  18. Checking Fact with Better Retrieval: Dynamic Contrastive Learning for Evidence Retrieval

    May 24, 2026Zhongtian Hua, Yi Luo, Meijia Yu +1Automated Fact-CheckingCross-Modal Retrieval

  19. Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval

    May 23, 2026Hao Sun, Yingyan Hou, Jiayan Guo +4Multimodal EmbeddingCross-Modal Retrieval

  20. What Are We Actually Decoding? Source Attribution for Non-Invasive Brain-to-Language Retrieval

    May 23, 2026Xinyu Zhang, Sichao Liu, Runhao Lu +2Neural DecodingCross-Modal Retrieval

  21. TIGER: Text-Informed Generalized Enzyme-Reaction Retrieval

    May 23, 2026Yuhang Zhang, Keyan Ding, Peilin Chen +5Cross-Modal RetrievalInformation Retrieval

  22. TempRet: Temporal Enhancement and Two-Stage Reranking for CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge

    May 23, 2026Zixu Li, Yupeng Hu, Zhiwei Chen +4Learning to RankCross-Modal Retrieval

  23. RE-TRIANGLE: Does TRIANGLE Enable Multimodal Alignment Beyond Cosine Similarity in Retrieval?

    May 22, 2026Arijit Ghosh, Aritra Bandyopadhyay, Chiranjeev Bindra +1Cross-Modal LearningCross-Modal Alignment

  24. STAMBRIDGE: Spectral-Temporal Amplitude-aware Mid-Feature Bridge for EEG Visual Decoding

    May 22, 2026Jiahe Meng, Weiming Zeng, Yueyang Li +5Cross-Modal Knowledge DistillationRepresentation Learning

  25. FashionLens: Toward Versatile Fashion Image Retrieval via Task-Adaptive Learning

    May 21, 2026Haokun Wen, Xuemeng Song, Xinghao Xie +3Multi-Task LearningImage-Text Retrieval

  26. MSAlign: Aligning Molecule and Mass Spectra Foundation Models for Metabolite Identification

    May 19, 2026Paul Krzakala, Gabriel Melo, Camille Lançon +4Distribution ShiftCross-Modal Alignment

  27. GeoMamba: A Geometry-driven MambaVision Framework and Dataset for Fine-grained Optical-SAR Object Retrieval

    May 19, 2026Tiantong Fang, Xiuwei Wang, Jing Xiao +3Cross-Modal Representation LearningGeometric Representation Learning