Audio Representation Learning

Latest papers 141

All topics
CardsList
  1. Alethia: A Foundational Encoder for Voice Deepfakes

    Apr 30, 2026Yi Zhu, Brahmi Dwivedi, Jayaram Raghuram +1Audio Representation LearningAudio Deepfake Detection

  2. From Birdsong to Rumbles: Classifying Elephant Calls with Out-of-Species Embeddings

    Apr 30, 2026Christiaan M. Geldenhuys, Thomas R. NieslerAudio Representation LearningAudio Understanding

  3. Multimodal LLMs are not all you need for Pediatric Speech Language Pathology

    Apr 29, 2026Darren Fürst, Sebastian Steindl, Ulrich SchäferAudio Representation LearningHealthcare

  4. S-SONDO: Self-Supervised Knowledge Distillation for General Audio Foundation Models

    Apr 27, 2026Mohammed Ali El Adlouni, Aurian Quelennec, Pierre Chouteau +2Model CompressionAudio Representation Learning

  5. Enhancing Speaker Verification with Whispered Speech via Post-Processing

    Apr 22, 2026Magdalena Gołębiowska, Piotr SygaAudio Representation LearningSpeaker Verification

  6. Speech Codec Probing from Semantic and Phonetic Perspectives

    Mar 11, 2026Xuan Shi, Chang Zeng, Tiantian Feng +3Audio Representation LearningNeural Audio Codecs

  7. An Empirical Analysis of Task-Induced Encoder Bias in Fréchet Audio Distance

    Feb 27, 2026Wonwoo JeongText-to-Audio GenerationAudio Representation Learning

  8. Scalable Music Cover Retrieval Using Lyrics-Aligned Audio Embeddings

    Jan 16, 2026Joanne Affolter, Benjamin Martin, Elena V. Epure +2Audio Representation LearningMusic Information Retrieval

  9. Linear probing enables Ship-Radiated Noise recognition with pretrained audio embeddings

    Jan 13, 2026Hilde I. Hummel, Sandjai Bhulai, Rob D. van der Mei +1Audio Representation LearningLinear Probing

  10. Harmonic-Percussive Disentangled Neural Audio Codec for Bandwidth Extension

    Nov 26, 2025Benoît Giniès, Xiaoyu Bie, Olivier Fercoq +1Audio Representation LearningNeural Audio Codecs

  11. Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation

    Nov 20, 2025Wei-Cheng Tseng, Xuanru Zhou, Mingyue Huo +3Audio-Language Model EvaluationAudio Representation Learning

  12. Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders

    Nov 7, 2025Mathias Rose Bjare, Giorgia Cantisani, Marco Pasini +2Audio Representation LearningDenoising Autoencoders

  13. OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder

    Jul 18, 2025Shikhar Bharadwaj, Samuele Cornell, Kwanghee Choi +4Audio Representation LearningAudio QA

  14. Structured-Noise Masked Modeling for Video, Audio and Beyond

    Mar 20, 2025Aritra Bhowmik, Carlos Hinojosa, Fida Mohammad Thoker +2Audio Representation LearningVideo Representation Learning

  15. Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

    Jan 25, 2025Yi Su, Jisheng Bai, Qisheng Xu +2Audio Representation LearningAudio Understanding

  16. ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions

    Date pendingThomas Thebaud, Junhyeok Lee, Laureano Moro-Velazquez +2Audio Representation LearningConditional Generative Modeling