Audio Representation Learning

Latest papers 141

All topics
CardsList
  1. Beyond Residual Connections: Manifold-Constrained Hyper-Connections for Robust Speaker Representation Learning

    Aug 6, 2026Zezhong Jin, Xiaoyu Wang, Zhe Li +4Audio Representation LearningResidual Learning

  2. MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation

    Aug 4, 2026Yizhong Geng, Wenxin Fu, Kecan Mao +7Audio Representation LearningNeural Audio Codecs

  3. Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens

    Jul 31, 2026Yi Luo, Rongzhi Gu, Jixun YaoFlow MatchingAudio Representation Learning

  4. Do Music Foundation Models Embed Pitch in Helical Structure?

    Jul 31, 2026Hayato Yagi, Shinnosuke Takamichi, Rin Sato +2Audio Representation LearningNeural Representation Geometry

  5. Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens

    Jul 28, 2026Daigo Takizawa, Tomohiko Nakamura, Samuele Cornell +3Audio Representation LearningNeural Audio Codecs

  6. Mind the Microphone Gap: Benchmarking Array Upsampling Strategies for Latent Acoustic Mapping

    Jul 27, 2026Philipp Schmidt, Huw Cheston, Juan Azcarreta +3Audio Representation LearningSelf-Supervised Learning

  7. Music-JEPA: Learning a World Model of Sound from Action

    Jul 24, 2026Ziyu Wang, Kun Fang, Yann LeCunAudio Representation LearningWorld Model Learning

  8. HARP: Harmonic-Aware Residual Partitioning for Neural Audio Codecs

    Jul 18, 2026Qiaoyu Yang, Lixing He, Binyue Deng +1Audio Representation LearningNeural Audio Codecs

  9. StemFX: Learning Mixing Style Representations via Autoregressive FX Chain Prediction on Source-Separated Stems

    Jul 17, 2026Yuan-Chiao Cheng, Jui-Te Wu, Brian Chen +3Audio Representation Learning

  10. Can Tokens Compete? Token Representations against Supervised CNN Backbones for BirdCLEF+ 2026

    Jul 16, 2026Anthony Miyaguchi, Murilo Gustineli, Adrian CheungAudio Representation LearningNeural Audio Codecs

  11. ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models

    Jul 10, 2026Sang-Hoon Lee, Ha-Yeong ChoiAudio Representation LearningLatent Diffusion Models

  12. Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models

    Jul 7, 2026Ho-Lam Chung, Ke-Han Lu, Yi-Cheng Lin +3Audio Representation LearningRepresentation Learning

  13. A Self-Supervised Approach for Minimal-Annotation Hydroacoustic Data Exploration

    Jul 7, 2026Pierre-Yves Raumer, Axel Marmoret, Dorian Cazau +6Audio Representation LearningSelf-Supervised Learning

  14. Streaming Neural Speech Codecs through Time-Invariant Representations

    Jul 6, 2026Kélian Estève, Salima Mhdaffar, Mickael Rouvier +2Audio Representation LearningNeural Audio Codecs

  15. CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning

    Jul 6, 2026Ganesh Pavan Kartikeya Bharadwaj Kolluri, Yuchen Zhang, Michael Kampouridis +1Audio Representation LearningAudio-Language Models

  16. Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings

    Jul 4, 2026Héctor Martel, Joe Hennessy-Priest, Taemin ChoRepresentation GeometryAudio Representation Learning

  17. Taste-aware music retrieval from audio embeddings

    Jul 3, 2026Matteo Spanio, Antonio RodàAudio Representation LearningCross-Modal Retrieval

  18. Quantifying the Uncertainty of Blindly Estimated Room Embeddings Using a Dispersion-Calibrated Score

    Jul 1, 2026Yang Xiang, Philipp Götz, Emanuël A. P. Habets +3Audio Representation LearningRepresentation Learning

  19. Evaluating Pretrained Music Embeddings for Cross-Performance Jazz Standard Recognition

    Jul 1, 2026Çağrı EserAudio Representation LearningMusic Information Retrieval

  20. BEST-RQ-2: Contextualize-Then-Predict, a Two-Step Approach for Self-Supervised Audio Representations

    Jun 29, 2026Ludovic K. Tuncay, Etienne Labbé, Thomas PellegriniAudio Representation LearningSelf-Supervised Pre-Training

  21. ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models

    Jun 27, 2026Fengjie Lu, Chenang Jiang, Jiarui Hai +2Audio Representation LearningAudio-Language Models

  22. From General-Purpose Audio Tagging to Spatially Grounded Sound Event Localization and Detection

    Jun 26, 2026Stefano Giacomelli, Stefano Damiano, Claudia Rinaldi +2Audio Representation LearningDirection-of-Arrival Estimation

  23. wav2tok 2.0: Scalable Audio Tokenization Maintaining Explicit Pairwise Token Alignment for Efficient Audio Retrieval

    Jun 25, 2026Adhiraj Banerjee, Vipul AroraAudio Representation LearningSpeech Processing

  24. WQ-Fusion: Dynamic Gated Attention for Cross-Domain Audio Representation

    Jun 25, 2026Mingda Lin, Lei Ding, Xinyue Zhou +6Audio Representation LearningGated Attention