Audio Representation Learning

Latest papers 140

All topics
CardsList
  1. Feature Encoding in VAE-based Audio Decoders: Effects of Input, Depth and Distribution

    Oct 6, 2026Louis McCallum, Mick GriersonVariational AutoencodersAudio Representation Learning

  2. Neural Representations, Natural Connections: What Transfers From Human Speech Foundation Models to Animal Vocalizations?

    Oct 5, 2026Tomás Arias-Vergara, Christopher Hauer, Héloïse Brotier +3Audio Representation LearningSpeech Foundation Models

  3. Do Speech Representations Preserve Regional Accent Across Read and Spontaneous Speech?

    Oct 5, 2026Paula A. Perez-Toro, Tomas Arias-Vergara, Annette Schwarz +4Audio Representation LearningSelf-Supervised Speech Representation Learning

  4. Beyond Decodability: Do Acoustic Factors Drive Predictions in Speech-Based Alzheimer's Assessment?

    Oct 1, 2026Serli Kopar, Alkis Koudounas, Roshan P. Rane +3Audio Representation LearningSpeech-Based Dementia Detection

  5. UniAE-MoE: A Unified Audio Encoder via Mixture of Experts

    Sep 30, 2026Shengbo Cai, Zhisheng Zhang, Zichao Nie +3Audio Representation LearningMixture of Experts

  6. VOSSA: Voiceprint Optimization for Streaming Speech Architectures

    Sep 30, 2026Mu-Ruei Tseng, Waris Quamer, Ghady Nasrallah +1Audio Representation LearningSpeech Processing

  7. RAST: Resolution-Aware Privileged Structure Transfer for Low-Resolution Audio Activity Recognition

    Sep 30, 2026Ji Hwan Park, Gautham Krishna Gudur, Yufei Shen +2Audio Representation LearningHuman Activity Recognition

  8. Multi-Rate Bandwidth Extension by Token Completion in Neural Audio Codecs

    Sep 29, 2026Benoît Ginies, Olivier Fercoq, Gaël RichardAudio Representation LearningNeural Audio Codecs

  9. Retrieving Individual Stems from Music Mixtures with Slot Embeddings

    Sep 28, 2026David Braun, Junyi Fan, Pranay Manocha +2Audio Representation LearningMulti-Vector Retrieval

  10. Rethinking Automated Voice Similarity by Shifting from EER to Embedding Geometry

    Sep 27, 2026Szu-Chi Chen, Jia-Kai Dong, Yi-Cheng Lin +2Audio Representation LearningSpeaker Verification

  11. YuE2: Unifying Symbolic and Audio Music Generation at Frontier Quality

    Sep 27, 2026Ruibin Yuan, Jiahao Pan, Junyan Jiang +32Audio Representation LearningControllable Music Generation

  12. What Survives the Codec Shift: Pooled No-Vocals Residuals for Speech Deepfake Detection

    Sep 27, 2026Jiajun Xu, Menglu Li, Xiao-Ping ZhangAudio Representation LearningAudio Deepfake Detection

  13. Joint Analysis of Latent Dimensionality and Frame Rate in Continuous Audio Encoders

    Sep 24, 2026Kyudan Jung, Sehyun Lee, Son-ha Jo +2Audio Token CompressionAudio Representation Learning

  14. UNITE-AUDIO: Joint Learning of Continuous Tokenization and Latent Flow Matching for Text-to-Audio Generation

    Sep 23, 2026Runwu Shi, Kai Li, Yujin Wang +8Text-to-Audio GenerationAudio Representation Learning

  15. Do Audio Representations Compose Additively?

    Sep 23, 2026Chenhao Xue, Zhijin Guo, Joyraj Chakraborty +2Audio Representation LearningCompositional Representation Learning

  16. Discrete vs. Continuous: A Comprehensive Study of Unified Audio Understanding in LALMs

    Sep 19, 2026Jing Peng, Zichao Nie, Zhisheng Zhang +2Audio-Language Model EvaluationAudio Representation Learning

  17. Training Music Sample Identification Models on Real Sample Pairs

    Sep 18, 2026R. Oguz Araz, Joan Serrà, Xavier Lizarraga-Seijas +3Audio Representation LearningMusic Information Retrieval

  18. Multi-Teacher Distillation for Cross-Domain Streaming Electrolaryngeal Speech Encoding

    Sep 16, 2026Benedikt Mayrhofer, Enrique Orozco Olivares, Franz Pernkopf +2Audio Representation LearningStreaming ASR

  19. Sample-Conditioned Representation Selection for Audio Few-Shot Learning

    Sep 15, 2026Fengrui Liu, Ningxin Shen, Yi Li +3Few-Shot Audio ClassificationAudio Representation Learning

  20. Task-Directed Residual AddUNet:Perfect-Reconstruction Routing for Full-Rate Representations

    Sep 14, 2026Vikram R. LakkavalliAudio Representation LearningRepresentation Learning

  21. Rethinking Procedural Audio Pre-training: Source Scaling and Objective Adaptation

    Sep 14, 2026Jiajun Peng, Fengrui Liu, Xinyu Liu +1Synthetic Data PretrainingAudio Representation Learning

  22. CoJEPA: Combining Contrastive Learning and JEPA for Global-Local Music Representations

    Aug 31, 2026Gabriel Meseguer-Brocal, Yuexuan Kong, Romain HennequinContrastive LearningAudio Representation Learning

  23. Pitch Contour Tokenization using VQ-VAE and Its Application on Korean Traditional Music Analysis

    Aug 11, 2026Seonguk Ju, Seola Cho, Sooin Chung +2Audio Representation LearningVector-Quantized Variational Autoencoder

  24. DINO-A: Adapting Self-Distillation Vision Transformers to General Audio Representation Learning

    Aug 11, 2026Tomasz Radzikowski, Mateusz Modrzejewski, Przemysław RokitaAudio Representation LearningSelf-Supervised Pre-Training

  25. Beyond Dry References: Learning Relative Audio Effects Representations via Contrastive Distance Learning

    Aug 11, 2026Xinlu Liu, Huibin Lin, Weixing Wei +1Contrastive LearningAudio Representation Learning

  26. Beyond Residual Connections: Manifold-Constrained Hyper-Connections for Robust Speaker Representation Learning

    Aug 6, 2026Zezhong Jin, Xiaoyu Wang, Zhe Li +4Audio Representation LearningResidual Learning

  27. MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation

    Aug 4, 2026Yizhong Geng, Wenxin Fu, Kecan Mao +7Audio Representation LearningNeural Audio Codecs

  28. Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens

    Jul 31, 2026Yi Luo, Rongzhi Gu, Jixun YaoFlow MatchingAudio Representation Learning

  29. Do Music Foundation Models Embed Pitch in Helical Structure?

    Jul 31, 2026Hayato Yagi, Shinnosuke Takamichi, Rin Sato +2Audio Representation LearningNeural Representation Geometry

  30. Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens

    Jul 28, 2026Daigo Takizawa, Tomohiko Nakamura, Samuele Cornell +3Audio Representation LearningNeural Audio Codecs

  31. Mind the Microphone Gap: Benchmarking Array Upsampling Strategies for Latent Acoustic Mapping

    Jul 27, 2026Philipp Schmidt, Huw Cheston, Juan Azcarreta +3Audio Representation LearningSelf-Supervised Learning

  32. Music-JEPA: Learning a World Model of Sound from Action

    Jul 24, 2026Ziyu Wang, Kun Fang, Yann LeCunAudio Representation LearningWorld Model Learning

  33. HARP: Harmonic-Aware Residual Partitioning for Neural Audio Codecs

    Jul 18, 2026Qiaoyu Yang, Lixing He, Binyue Deng +1Audio Representation LearningNeural Audio Codecs

  34. StemFX: Learning Mixing Style Representations via Autoregressive FX Chain Prediction on Source-Separated Stems

    Jul 17, 2026Yuan-Chiao Cheng, Jui-Te Wu, Brian Chen +3Audio Representation Learning

  35. Can Tokens Compete? Token Representations against Supervised CNN Backbones for BirdCLEF+ 2026

    Jul 16, 2026Anthony Miyaguchi, Murilo Gustineli, Adrian CheungAudio Representation LearningNeural Audio Codecs

  36. ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models

    Jul 10, 2026Sang-Hoon Lee, Ha-Yeong ChoiAudio Representation LearningLatent Diffusion Models

  37. Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models

    Jul 7, 2026Ho-Lam Chung, Ke-Han Lu, Yi-Cheng Lin +3Audio Representation LearningRepresentation Learning

  38. A Self-Supervised Approach for Minimal-Annotation Hydroacoustic Data Exploration

    Jul 7, 2026Pierre-Yves Raumer, Axel Marmoret, Dorian Cazau +6Audio Representation LearningSelf-Supervised Learning

  39. Streaming Neural Speech Codecs through Time-Invariant Representations

    Jul 6, 2026Kélian Estève, Salima Mhdaffar, Mickael Rouvier +2Audio Representation LearningNeural Audio Codecs

  40. CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning

    Jul 6, 2026Ganesh Pavan Kartikeya Bharadwaj Kolluri, Yuchen Zhang, Michael Kampouridis +1Audio Representation LearningAudio-Language Models

  41. Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings

    Jul 4, 2026Héctor Martel, Joe Hennessy-Priest, Taemin ChoRepresentation GeometryAudio Representation Learning

  42. Taste-aware music retrieval from audio embeddings

    Jul 3, 2026Matteo Spanio, Antonio RodàAudio Representation LearningCross-Modal Retrieval

  43. Quantifying the Uncertainty of Blindly Estimated Room Embeddings Using a Dispersion-Calibrated Score

    Jul 1, 2026Yang Xiang, Philipp Götz, Emanuël A. P. Habets +3Audio Representation LearningRepresentation Learning

  44. Evaluating Pretrained Music Embeddings for Cross-Performance Jazz Standard Recognition

    Jul 1, 2026Çağrı EserAudio Representation LearningMusic Information Retrieval

  45. BEST-RQ-2: Contextualize-Then-Predict, a Two-Step Approach for Self-Supervised Audio Representations

    Jun 29, 2026Ludovic K. Tuncay, Etienne Labbé, Thomas PellegriniAudio Representation LearningSelf-Supervised Pre-Training

  46. ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models

    Jun 27, 2026Fengjie Lu, Chenang Jiang, Jiarui Hai +2Audio Representation LearningAudio-Language Models

  47. From General-Purpose Audio Tagging to Spatially Grounded Sound Event Localization and Detection

    Jun 26, 2026Stefano Giacomelli, Stefano Damiano, Claudia Rinaldi +2Audio Representation LearningDirection-of-Arrival Estimation

  48. wav2tok 2.0: Scalable Audio Tokenization Maintaining Explicit Pairwise Token Alignment for Efficient Audio Retrieval

    Jun 25, 2026Adhiraj Banerjee, Vipul AroraAudio Representation LearningSpeech Processing

  49. WQ-Fusion: Dynamic Gated Attention for Cross-Domain Audio Representation

    Jun 25, 2026Mingda Lin, Lei Ding, Xinyue Zhou +6Audio Representation LearningGated Attention

  50. Frequency-Aware Self-Supervised Music Representation Learning

    Jun 24, 2026Yicheng Gu, Junan Zhang, Jerry Li +2Audio Representation LearningFrequency-Domain Feature Learning