Cross-Modal Retrieval

Latest papers 139

All topics
CardsList
  1. Generative Universal Multimodal Retrieval with Dual-role Identifiers

    Aug 13, 2026Kaipeng Li, Haitao Yu, Xuanchen ZhouMultimodal IRGenerative Retrieval

  2. Heterogeneous Vision-Language Ensemble with Disagreement-Aware Reranking for Text-Based Person Anomaly Retrieval

    Aug 13, 2026Huu-An Vu, Cam Tu Tran Thi, Thanh Toan Le Ngo +5Vision-Language ModelsMultimodal Reranking

  3. CertBind from Multimodal Connectivity to Certifiable Retrieval Decisions

    Aug 6, 2026Shuheng Cao, Zhenhao Zhang, Ruiqi Chen +7Selective PredictionConformal Prediction

  4. Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes

    Aug 5, 2026Quynh Vo, Thong Nguyen, Vinh-Hien Do +2Cross-Modal RetrievalVideo Prediction

  5. Multimodal Alignment Through Joint Kernel Entropic Gromov--Wasserstein Optimal Transport

    Aug 4, 2026Yixuan Florence Wu, Yilun Zhu, Naichen ShiCross-Modal AlignmentMultimodal Embedding

  6. Geo-Embed: Towards Unified Multimodal Embeddings for Urban Understanding

    Aug 4, 2026Jiapeng Li, Yong Li, Junjie Zhou +2Geospatial Representation LearningCross-Modal Retrieval

  7. SeCo-SBIR: Semantically Consistent Prompt Learning for Zero-Shot Sketch-Based Image Retrieval

    Aug 4, 2026Long Hoang Dang, Tuan Nguyen Huu, Nguyen Minh Hieu +1VLM AdaptationCross-Modal Retrieval

  8. Zero-Cost Virtual RNA: Approximating Immunotherapy Signatures via Cross-Modal WSI Retrieval

    Aug 1, 2026Sigrid Vila-Bagaria, Mar Teixidó, Miquel Piñol +3Computational PathologyCross-Modal Retrieval

  9. ReLoop-UME: Recurrent Depth with Learnable Retrieval Registers for Universal Multimodal Embedding

    Jul 30, 2026Shijie Wang, Xiangzhao Hao, Yueti Li +3Efficient Multimodal InferenceMultimodal Embedding

  10. From Cellular Responses to Pharmacological Domains: Multimodal Zero-Shot Drug Representation Learning

    Jul 28, 2026Jintao Huang, Lu Leng, Ziyuan YangCross-Modal RetrievalMolecular Property Prediction

  11. DSCH-Loss: A Dynamic Semantic Channel Objective for Deep Semantic Hashing

    Jul 27, 2026Tobias J. Bauer, Christian Riess, Daniel Loebenberger +1Cross-Modal Representation LearningCross-Modal Retrieval

  12. Controlling Embedding Spaces with Text-Conditioned Transformations

    Jul 24, 2026Joseph Fioresi, Fabian Caba Heilbron, Pankaj Nathani +2Representation DisentanglementMultimodal Embedding

  13. Achieving Text-based Person Retrieval with Any Granularity

    Jul 23, 2026Jialong Zuo, Hanyu Zhou, Dongyue Wu +5Cross-Modal RetrievalInformation Retrieval

  14. Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval

    Jul 23, 2026Kyeongmo Chae, Jihoon Lee, Sangtae AhnRepresentation LearningCross-Modal Alignment

  15. Diverse-Intent Multi-Turn Fashion Image Retrieval

    Jul 22, 2026Mingqiang Tang, Haokun Wen, Meng Liu +3Multimodal IRCross-Modal Alignment

  16. GATE-3D: Geometry-Aware Test-time Adaptive Reranking for Open-Set 3D Shape Retrieval

    Jul 21, 2026Hao Wu, Heyi Lin, Zilin Wang +3Learning to RankCross-Modal Retrieval

  17. Dual-Edged Homogeneous-Modality Similarity: Towards Visible-Infrared Modality-Incomplete Person Re-Identification with Modality Adaptive Matching

    Jul 21, 2026Xin Xu, Shuhao Zhan, Wei Liu +3Missing-Modality LearningCross-Modal Representation Learning

  18. Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio

    Jul 21, 2026Abdul Basit Tonmoy, Kazi Fardinul Hoque, Md. Shahrier Islam Arham +1VLM AdaptationMultimodal Embedding

  19. FSDBN: Foreground-Aware EEG-Visual Alignment via Dynamic Brain Networks

    Jul 20, 2026Yiheng Liu, Chuhang Zheng, Peiliang Gong +3EEG-Based Visual DecodingCross-Modal Alignment

  20. AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning

    Jul 16, 2026Sarthak Jain, Qiran Hu, Zhen Zhu +1Cross-Modal Representation LearningCross-Modal Alignment

  21. Local Multimodal Music Alignment from Global Supervision

    Jul 10, 2026Irmak Bukey, Zachary Novack, Jongmin Jung +2Cross-Modal AlignmentCross-Modal Retrieval

  22. Semantic Hardness Is Not Visual Hardness: Sign-Aware Hard Negative Mining for Sign Language Retrieval

    Jul 10, 2026Junmyeong Lee, Chan Hur, ChangSu Choi +5Hard Negative MiningCross-Modal Retrieval

  23. MatBind: A Shared Embedding Space for Multimodal Materials Characterization

    Jul 9, 2026Le Yang, Anoop K. Chandran, Jona Östreicher +8Cross-Modal AlignmentMultimodal Embedding

  24. What Images Cannot Say: Language-Guided Olfactory Representation Learning

    Jul 7, 2026Eleftherios Tsonis, Xi Wang, Vicky KalogeitonDisentangled Representation LearningRepresentation Learning

  25. Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking

    Jul 7, 2026Seungheon Doh, Minhee Lee, Sangmoon Lee +2Cross-Modal AlignmentMultimodal Embedding

  26. Taste-aware music retrieval from audio embeddings

    Jul 3, 2026Matteo Spanio, Antonio RodàAudio Representation LearningCross-Modal Retrieval

  27. Attribute-Prompted Kernel Hashing for Unsupervised Data-Efficient Cross-Modal Retrieval

    Jul 1, 2026Runhao Li, Xiaoxu Ma, Zhenyu Weng +5Cross-Modal AlignmentCross-Modal Retrieval

  28. Unsupervised Data-Efficient Cross-Modal Retrieval with Global-Neighborhood Alignment Hashing

    Jun 30, 2026Runhao Li, Xiaoxu Ma, Zhenyu Weng +5Cross-Modal AlignmentCross-Modal Retrieval