Audio-Text Retrieval

Momentum

4 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 18

All topics
CardsList
  1. VoiceTrace: A Benchmark and Retrieval Framework for Who-Said-What Speech Retrieval

    Sep 16, 2026Aaron Yee, Fengjie Lu, Jiarui Hai +5Audio-Text RetrievalHybrid Retrieval

  2. MUUNRiver-Bench: Diagnosing Relation-Dependent Music Retrieval with Multimodal Instructions

    Sep 14, 2026Zhancheng Guo, Congren Dai, Shangda Wu +4Audio-Language Model EvaluationAudio-Text Retrieval

  3. Overview and Meta-Analysis of DCASE 2026 Challenge Task 6: Audio Moment Retrieval from Long Audio

    Sep 11, 2026Hokuto Munakata, Tatsuya Komatsu, Keisuke Imoto +3Audio-Text Retrieval

  4. SonicCaps: Large-Scale Diverse and Fine-Grained Captioning for Improved Audio-Retrieval

    Sep 2, 2026Zineb Lahrichi, Marc Ferras, Gaël Richard +1Audio CaptioningAudio-Language Models

  5. Steering dense music retrieval with open-vocabulary concept discovery

    Aug 9, 2026Julien Guinot, Alain Riou, Elio Quinton +1Feature AttributionSparse Autoencoders

  6. The Sound of Absence: Audio-Language Embedding Models Struggle with Negation

    Jul 14, 2026Chun-Yi Kuan, Hung-yi LeeAudio-Language Model EvaluationAudio-Language Models

  7. ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models

    Jun 27, 2026Fengjie Lu, Chenang Jiang, Jiarui Hai +2Audio Representation LearningAudio-Language Models

  8. ATCCaps: A Call-Sign-Aware Speech Dataset for Air Traffic Control Recognition

    Jun 21, 2026Dongdong Li, Jianwei Song, Jianwei Wang +1ASR EvaluationAutomatic Speech Recognition

  9. MixProLAP: Mixture-Induced Uncertainty Modeling for Probabilistic Language-Audio Pretraining

    Jun 18, 2026Yu Nakagome, Jaesong Lee, Soo-Whan ChungMultimodal PretrainingAudio-Language Models

  10. FIGMA: Towards FIne-Grained Music retrievAl

    Jun 4, 2026Nishit Anand, Ashish Seth, Sreyan Ghosh +2Audio UnderstandingAudio-Text Retrieval

  11. Forgive or forget: Understanding the context of hate in audio retrieval systems

    Jun 4, 2026Arghya Pal, Sailaja Rajanala, Raphael C. -W. Phan +1Content ModerationAudio-Text Retrieval

  12. ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval

    May 5, 2026Honglei Zhang, Yuting Chen, Chenpeng Hu +2Audio ReasoningAudio Understanding

  13. ATIR: Towards Audio-Text Interleaved Contextual Retrieval

    Apr 22, 2026Tong Zhao, Chenghao Zhang, Yutao Zhu +1Multimodal IRMultimodal Large Language Models

  14. Re-purposing Multimodal Large Language Models for Audio-Text Retrieval

    Feb 20, 2026Jilan Xu, Carl Thomé, Danijela Horak +2Multimodal Large Language ModelsAudio Understanding