Audio Representation Learning

Latest papers 141

All topics
CardsList
  1. Frequency-Aware Self-Supervised Music Representation Learning

    Jun 24, 2026Yicheng Gu, Junan Zhang, Jerry Li +2Audio Representation LearningFrequency-Domain Feature Learning

  2. PHAST-Net: Attention-Guided, Physics-Informed Network for Unified Estimation of Ideal Time-Frequency Representations

    Jun 22, 2026James M. Cozens, Simon J. GodsillAudio Representation LearningWavelet Methods

  3. STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation

    Jun 22, 2026Huadai Liu, Wen Wang, Kaicheng Luo +3Variational AutoencodersText-to-Audio Generation

  4. Toward Open-Set Speaker Attribute Prediction with Keyword-Appended LLM Embeddings

    Jun 20, 2026Byoungjun So, Jaejun Lee, Kyogu LeeAudio Representation LearningSpeech Processing

  5. ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion

    Jun 20, 2026Jeongsoo Choi, Ji-Hoon Kim, Shujie Hu +1Audio Representation LearningNeural Audio Codecs

  6. CoughPhase-CLR: Designing an acoustics-informed foundation model for coughing sound classification

    Jun 19, 2026Marius Moldovan, Anton Batliner, Thomas M. Berghaus +2Contrastive LearningAudio Representation Learning

  7. LISE : Listenable Interpretable Speaker Embeddings

    Jun 19, 2026Xiaoliang Wu, Chongxin Gan, Ke Liu +2Audio Representation LearningSpeaker Verification

  8. Segment-Level Mandarin Chinese Speech-Based Cognitive Impairment Detection via an Autoencoder with Contrastive Learning

    Jun 18, 2026Yongqi Shao, Hong Huo, Flavio Bertini +2Audio Representation LearningRepresentation Learning

  9. Acoustic Prompting via Stage-wise Modulation for Few-Shot Learning in Audio Language Models

    Jun 14, 2026Hyebin Cho, Jaehyuk Jang, Changick Kim +1Few-Shot Audio ClassificationAudio Representation Learning

  10. Spectro-Temporal Interference Confounds Phase Encoding in Spatial Audio Foundation Models

    Jun 12, 2026Yuxuan Chen, Haoyuan Yu, Peize HeAudio Representation LearningDirection-of-Arrival Estimation

  11. Spatio-Temporal Audio Language Modeling for Dynamic Sound Sources

    Jun 12, 2026Oh Hyun-Bin, Kazuki Shimada, Yuhta Takida +6Audio-Language Model EvaluationAudio Representation Learning

  12. From Tokens to Faces: Investigating Discrete Speech Representations for 3D Facial Animation

    Jun 11, 2026Pedro Correa, Olivier Perrotin, Samir Sadok +2Audio Representation LearningNeural Audio Codecs

  13. Decoding Insect Song: A Multitask Semisupervised Orthoptera Bioacoustic Classifier

    Jun 11, 2026Olga Isupova, Danil Kuzin, Ella Browning +2Audio Representation LearningAudio Understanding

  14. From Physics to Representation: Audio Learning with Synthetic Pre-training via Procedural Generation

    Jun 11, 2026Fengrui Liu, Ruiyang Huang, Qijian Zheng +2Synthetic Data PretrainingAudio Representation Learning

  15. Dolph2Vec: Self-Supervised Representations of Dolphin Vocalizations

    Jun 10, 2026Chiara Semenzin, Faadil Mustun, Roberto Dessi +5Audio Representation LearningAudio Understanding

  16. Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation

    Jun 10, 2026Zhen Ye, Xu Tan, Yiming Li +10Spoken Language UnderstandingAudio Representation Learning

  17. SARA: A Dual-Stream VAE for High-Fidelity Speech Generation via Integrating Semantic and Acoustic Representations

    Jun 10, 2026Peijie Chen, Wenhao Guan, Weijie Wu +7Variational AutoencodersAudio Representation Learning

  18. Speaker Group Encoding in Self-supervised Speech Recognition Models

    Jun 9, 2026Felix Herron, Solange Rossato Alexandre Allauzen, Benoit Favre +1Audio Representation LearningDemographic Bias in ASR

  19. ViP-VL: Vietnamese Self-supervised Speech Pretraining Model with Vector-Quantization Learning

    Jun 9, 2026Khanh Le, Kiet Anh Hoang, Bao Nguyen +5Audio Representation LearningSpeech Processing

  20. Dual-Branch Gated Fusion for Open-Set Audio Deepfake Source Tracing

    Jun 8, 2026Awais Khan, Kutub Uddin, Khalid MalikAudio Representation LearningAudio Deepfake Detection

  21. Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs

    Jun 8, 2026Ming-Hao Hsu, Yuxuan Hu, Shujie Liu +3Audio Representation LearningAudio Understanding

  22. Multi-View Speech Representation Learning for Parkinson's Disease Detection Using Context-guided Cross-modal Attention

    Jun 8, 2026George Theodosiou, Loukas Ilias, Dimitris AskounisAudio Representation LearningSpeech Processing

  23. Probing Token Spaces under Generator Shift in AI-Generated Music Detection

    Jun 7, 2026Joonyong Park, Jungwoo Kim, Junyoung Koh +1Audio Representation LearningAudio Deepfake Detection

  24. USAD 2.0: Scaling Representation Distillation for Universal Audio Understanding

    Jun 4, 2026Heng-Jui Chang, Alexander H. Liu, Saurabhchand Bhati +4Audio Representation LearningAudio Understanding

  25. F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation

    Jun 4, 2026Dinghao Zhou, Xingchen Song, Di Wu +3Audio Representation LearningAutoencoders

  26. Do speech foundation models perceive speaker similarity as humans do?

    Jun 4, 2026Minoru Kishi, Hayato Yagi, Shinnosuke Takamichi +1Audio Representation LearningSpeech Foundation Models

  27. InfoShield: Privacy-Preserving Speech Representations for Mental Health Screening via Information-Theoretic Optimization

    Jun 4, 2026Xueyang Wu, Siyuan Liu, Kezhuo Yang +1Audio Representation LearningDepression Detection

  28. Probing Spatial Structure in Pretrained Audio Representations

    Jun 4, 2026Chuyang Chen, Sivan Ding, Adrian S. Roman +1Audio Representation LearningRepresentation Probing

  29. CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding

    Jun 3, 2026Eugene Kwek, Feng Liu, Rui Zhang +1Audio Token CompressionAudio Representation Learning

  30. UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception

    May 29, 2026Yuhan Song, Linhao Zhang, Aiwei Liu +6Audio Representation LearningAudio Understanding

  31. Extracting accent features in spoken Brazilian Portuguese without sociolinguistic labels

    May 28, 2026Pedro H. L. Leite, Pedro Benevenuto Valadares, Luiz W. P. BiscainhoAudio Representation LearningSpeech Processing

  32. HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding

    May 28, 2026Bohan Li, Shi Lian, Hankun Wang +6Audio Representation LearningSpeech Foundation Models

  33. MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables

    May 28, 2026Sung-Lin Yeh, Wei Zhou, Gil Keren +6Audio Representation LearningAutoregressive Language Modeling

  34. LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation

    May 27, 2026Zhisheng Zhang, Xiang Li, Yixuan Zhou +3Audio Token CompressionAudio Representation Learning

  35. Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

    May 27, 2026Jiahao Mei, Heinrich Dinkel, Yadong Niu +7Text-to-Audio GenerationAudio Representation Learning

  36. MERIT: Learning Disentangled Music Representations for Audio Similarity

    May 26, 2026Abhinaba Roy, Junyi Liang, Dorien HerremansDisentangled Representation LearningAudio Representation Learning

  37. StreamSplit: Continuous Audio Representation Learning via Uncertainty-Guided Adaptive Splitting

    May 26, 2026Minh K. Quan, Pubudu N. PathiranaContrastive LearningAudio Representation Learning

  38. SAME: A Semantically-Aligned Music Autoencoder

    May 18, 2026Julian D. Parker, Zach Evans, CJ Carr +4Audio Representation LearningNeural Audio Codecs

  39. SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning

    May 14, 2026KiHyun Nam, Jungwoo Heo, Siu Bae +2Audio Representation LearningSpeaker Verification

  40. AudioMosaic: Contrastive Masked Audio Representation Learning

    May 14, 2026Hanxun Huang, Qizhou Wang, Xingjun Ma +3Audio Representation LearningSelf-Supervised Pre-Training

  41. Exploring Token-Space Manipulation in Latent Audio Tokenizers

    May 11, 2026Francesco Paissan, Luca Della Libera, Mirco Ravanelli +1Audio Representation LearningNeural Audio Codecs

  42. AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling

    May 11, 2026Jiacheng Shi, Hongfei Du, Xinyuan Song +3Audio Representation LearningNeural Audio Codecs

  43. Voice Biomarkers for Depression and Anxiety

    May 11, 2026Oleksii Abramenko, Noah D. Stein, Colin VazAudio Representation LearningDepression Detection

  44. TARNet: A Temporal-Aware Multi-Scale Architecture for Closed-Set Speaker Identification

    May 8, 2026Yassin Terraf, Youssef IraqiAudio Representation LearningTemporal Convolutional Networks

  45. WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling

    May 7, 2026Guanrou Yang, Tian Tan, Qian Chen +12Audio Representation LearningTTS Synthesis

  46. Benchmarking LLMs on the Massive Sound Embedding Benchmark (MSEB)

    May 6, 2026Cyril Allauzen, Tom Bagby, Georg Heigold +2Audio-Language Model EvaluationLLM Evaluation

  47. PHALAR: Phasors for Learned Musical Audio Representations

    May 5, 2026Davide Marincione, Michele Mancusi, Giorgio Strano +4Audio Representation LearningRepresentation Learning

  48. Shao: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation

    May 3, 2026Jiafeng Liu, Yuanliang Dong, Hongjia Liu +8Text-to-Music GenerationAudio Representation Learning