Vision-Language Retrieval

Latest papers 62

All topics
CardsList
  1. VEDJE: Video-Efficient Discriminative Joint Encoder for Scalable Video-Text Retrieval

    Oct 8, 2026Shahaf Wagner, Gabriele Serussi, Dan Ben Ami +2Video RetrievalVision-Language Retrieval

  2. SoccerNet-FoulRet: Retrieving Semantically Similar Soccer Foul Videos

    Oct 7, 2026Jacobus Arthur, Ahmad Sait, Batool Hani +6Video RetrievalSports Video Analysis

  3. AiSearch: Interactive Multi-Modal Search with VLMs

    Oct 1, 2026Ali Koksal, Mei Chee Leong, Vicky Sintunata +2Multimodal IRVision-Language Models

  4. LazySloth: Bounded LLM-based Lazy Tree Search for Fast Long Video Comprehension

    Sep 29, 2026Arka Mukherjee, Kaleen Shrestha, Larissa Zhu +1Efficient VLM InferenceLong-Video Understanding

  5. MINER: Multi-crop INference-time Enhancement for Rare-Object Retrieval with Frozen Dual Encoders

    Sep 22, 2026Abdulmalik Alquwayfili, Faisal AlMeshal, Jumanah Almajnouni +2Vision-Language RetrievalImage Retrieval

  6. Human-Grounded Calibration for Long-Text Image-Text Congruence in Vision-Language Models

    Sep 14, 2026Alessandro Gambetti, Qiwei HanText-Image AlignmentVision-Language Retrieval

  7. Bridging the Semantic-Utility Gap in Multimodal RAG via Generator-in-the-Loop Alignment

    Sep 8, 2026Zhan-Lun Chang, Dong-Jun Han, Seyyedali Hosseinalipour +2Multimodal RAGMultimodal Reranking

  8. A Reverse Sign Language Dictionary: Open-Vocabulary Sign Recognition from Continuous Signing via Video Captioning and Description Retrieval

    Sep 3, 2026Santiago Poveda-Gutiérrez, Hideki Nakayama, Mayumi BonoVideo CaptioningVision-Language Retrieval

  9. From Saliency to Discriminability: Rank-Preserving Visual Token Pruning for VLM Rerankers

    Sep 1, 2026Siyi Liu, Hanjun Yang, Chenchen Zhang +7Efficient VLM InferenceMultimodal Reranking

  10. Heterogeneous Vision-Language Ensemble with Disagreement-Aware Reranking for Text-Based Person Anomaly Retrieval

    Aug 13, 2026Huu-An Vu, Cam Tu Tran Thi, Thanh Toan Le Ngo +5Vision-Language ModelsMultimodal Reranking

  11. MASCOT: Model-Aware Submodular Coverage for Composite-Attribute Text-to-Image Retrieval

    Aug 12, 2026Aaryan Sharma, Vishak Prasad C, Virendra Singh +1Vision-Language RetrievalImage Retrieval

  12. Rethinking Text-Based Image Retrieval in Specific Domain

    Aug 11, 2026Jingyang Tan, Sheng Yang, Yuanpeng Chen +4Image-Text RetrievalVision-Language Retrieval

  13. FaLCon: Facet-Anchored Retrieval with Late Consensus for Sim2Real Text-Based Person Anomaly Search

    Aug 10, 2026Hieu Dinh Trung Pham, Phuong Huu Vu Tran, Thuan Duc Mai +6Fine-Grained Image RetrievalSim-to-Real Transfer

  14. MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval

    Aug 8, 2026Fulong Liu, Liang Xu, Chengqun Yang +3Cross-Modal AlignmentInformation Retrieval

  15. ReToken: Improving Long-Context VLMs with Visual Retrieval Token

    Jul 30, 2026Yao Xiao, Reuben Tan, Zhen Zhu +3Vision-Language ModelsVision-Language Retrieval

  16. FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval

    Jul 30, 2026Bohan Hou, Haoqiang Lin, Xuemeng Song +4Fine-Grained Image RetrievalMultimodal Large Language Models

  17. Fine-Grained Food Image Understanding via Target-Aware Data Alignment

    Jul 28, 2026Jui-Feng Chi, Wei-Lun Chu, Bruce Coburn +2Fine-Grained Image RetrievalFine-Grained Image Classification

  18. Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models

    Jul 25, 2026Sultan Alshehri, Zhantao Yang, Han Zhang +1Vision-Language ModelsVLM Reasoning

  19. Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data

    Jul 10, 2026Valentin Gabeff, Baptiste Maquignaz, Jennifer Shan +5Vision-Language RetrievalWildlife Monitoring

  20. Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval

    Jul 6, 2026Suhyeong Park, Junha Jung, Jungwoo Park +1Token MergingMulti-Vector Retrieval

  21. HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding

    Jul 1, 2026Ji Ha Jang, Hayeon Kim, Chulwon Lee +2VLM RobustnessVision-Language Models

  22. RAVEN: Long-Horizon Reasoning & Navigation with a Visuo-Spatio-Temporal Memory

    Jun 23, 2026Yixun Hu, Zhicheng Zheng, Lihan Zha +5Robot NavigationEmbodied QA

  23. MAPS: Multi-Anchor Projection Similarity for Joint Vision-Language Geo-Localization

    Jun 21, 2026Yutong Hu, Siyuan Tan, Shaocheng Yan +3Cross-View Geo-LocalizationGeometric Representation Learning

  24. Look Before You Zoom: Adaptive Routing for the Resolution-Context Trade-off in Visual RAG

    Jun 20, 2026Oanh N. Tran, Thanh Quoc Hung Le, Oscar Chew +2Multimodal RAGEfficient VLM Inference