Cross-Modal Retrieval

Latest papers 134

All topics
CardsList
  1. A Strong Baseline for Evaluating Vision Encoders in Multimodal Large Language Models

    Oct 4, 2026Yilin Yang, Jun-Tao Tang, Kengyi Wang +3VLM EvaluationMultimodal Large Language Models

  2. Cross-Modal Contrastive Learning for the Retrieval of Immunotherapy-Associated Molecular Signatures from Histopathology

    Oct 4, 2026Sigrid Vila-Bagaria, Mar Teixidó, Miquel Piñol +3Computational PathologyCross-Modal Retrieval

  3. Omni-Embed-Mini: Binding Modalities Without Forgetting via Dense Distillation

    Oct 1, 2026Mohammed Irfan Kurpath, Jaseel Muhammad Kaithakkodan, Sahal Shaji Mullappilly +2Cross-Modal Knowledge DistillationMultimodal Embedding

  4. AVSD-Scenes: A Dataset for Audio-Visual Description of Urban Scenes

    Oct 1, 2026Dhanunjaya Varma Devalraju, Arshdeep Singh, Mark D. PlumbleyAudio-Visual UnderstandingCross-Modal Retrieval

  5. Spherical Interpolation for Backward-Compatible Multimodal Representations

    Sep 30, 2026Simone Ricci, Niccolò Biondi, Federico PerniciCross-Modal AlignmentCross-Modal Retrieval

  6. CurvSpec: Adaptive Multi-Curvature Learning for Partial Relevant Video Retrieval

    Sep 29, 2026Zhen Liu, Letian Li, Jinpeng Wang +4Cross-Modal RetrievalVideo Representation Learning

  7. Revitalizing Medical Time Series with Vision-Informed Retrieval: A Vision-Language Perspective

    Sep 28, 2026Guoqi Yu, Juncheng Wang, Shujun WangMultivariate Time Series ClassificationTime Series Classification

  8. HUMAN-TCI: Hierarchical Multi-Stream Motion-Aware Network with Torso-Centered Interaction for Text-to-Motion Retrieval

    Sep 28, 2026Muhammad Islam, Euijoon Ahn, Usman Naseem +1Cross-Modal RetrievalMotion Representation Learning

  9. Learning Multimodal Embeddings with Evidence-Aligned Readout

    Sep 27, 2026Zirong Chen, Fuda Ye, Enjun Du +8Multimodal Large Language ModelsMultimodal Embedding

  10. Discovery-Driven Integration of Disjoint Tables via Text

    Sep 22, 2026Md Ataur Rahman, Dimitris Sacharidis, Oscar Romero +1Cross-Modal RetrievalTabular Representation Learning

  11. The Visual Target Matters: Learning across the Visual Hierarchy for Brain-to-Image Retrieval

    Sep 21, 2026Ye Wang, Haokun Ren, Hong Yu +4Visual Representation LearningEEG-Based Visual Decoding

  12. Adaptive Cortically Constrained EEG-Vision Alignment for Zero-Shot Brain-to-Image Retrieval

    Sep 21, 2026Ye Wang, Haokun Ren, Wei Wu +4ElectroencephalographyEEG-Based Visual Decoding

  13. RPA: Residual Patch-Token Adapter for Image Retrieval from EEG and MEG

    Sep 19, 2026Yuhui Jin, Yonghao Song, Bingchuan LiuCross-Subject EEG DecodingCross-Modal Representation Learning

  14. SCOUT: Sim-to-Real Text-Based Person Retrieval by Embedding-Space Prediction over Frozen Video Features

    Sep 16, 2026Abdarahmane Traoré, Andy Couturier, Éric HervetSynthetic-to-Real Domain AdaptationMultimodal Embedding

  15. Hub-Spectral Activation of Latent Multimodal Knowledge

    Sep 15, 2026Ying Guo, Haidong Chen, Linrui Xu +7Cross-Modal Representation LearningCross-Modal Alignment

  16. Query-Conditioned Spherical Centroid Aggregation for Multimodal Retrieval

    Sep 14, 2026Ambuj Mehrish, Anindya Nag, Sebastiano VasconMultimodal RobustnessCross-Modal Retrieval

  17. TeMo: Temperature Modulation for Multimodal Contrastive Learning

    Sep 7, 2026Dhimitrios Duka, Bernt Schiele, Hilde Kuehne +1Cross-Modal RetrievalMultimodal Classification

  18. CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation

    Sep 3, 2026Tingyu Song, Mingxin Li, Yanzhao Zhang +5Multimodal EmbeddingCross-Modal Retrieval

  19. V2TATC: Joint Voice-Trajectory Embedding and Dataset for Air Traffic Controller Situational Awareness

    Aug 29, 2026Louis Brusset, Mathurin Petit, Jordan Kam +1Air Traffic ManagementCross-Modal Retrieval

  20. Who Remains, What Changes: Identity Anchored Composed Gait Retrieval

    Aug 27, 2026Jingchen Fei, Zengbin Wang, Yukun Liu +3Cross-Modal RetrievalGait Recognition

  21. When Images Look Right and Retrieve Wrong: Coverage-Guided Cross-Scale Re-Indexing for Knowledge-Faithful Generative Perception

    Aug 21, 2026Guangyuan Dong, Chuang Liu, Haoyu Wang +10Multimodal IRRemote Sensing

  22. Generative Universal Multimodal Retrieval with Dual-role Identifiers

    Aug 13, 2026Kaipeng Li, Haitao Yu, Xuanchen ZhouMultimodal IRGenerative Retrieval

  23. Heterogeneous Vision-Language Ensemble with Disagreement-Aware Reranking for Text-Based Person Anomaly Retrieval

    Aug 13, 2026Huu-An Vu, Cam Tu Tran Thi, Thanh Toan Le Ngo +5Vision-Language ModelsMultimodal Reranking

  24. CertBind from Multimodal Connectivity to Certifiable Retrieval Decisions

    Aug 6, 2026Shuheng Cao, Zhenhao Zhang, Ruiqi Chen +7Selective PredictionConformal Prediction

  25. Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes

    Aug 5, 2026Quynh Vo, Thong Nguyen, Vinh-Hien Do +2Cross-Modal RetrievalVideo Prediction

  26. Multimodal Alignment Through Joint Kernel Entropic Gromov--Wasserstein Optimal Transport

    Aug 4, 2026Yixuan Florence Wu, Yilun Zhu, Naichen ShiCross-Modal AlignmentMultimodal Embedding