Audio Representation Learning

Latest papers 141

All topics
CardsList
  1. Do speech foundation models perceive speaker similarity as humans do?

    Jun 4, 2026Minoru Kishi, Hayato Yagi, Shinnosuke Takamichi +1Audio Representation LearningSpeech Foundation Models

  2. InfoShield: Privacy-Preserving Speech Representations for Mental Health Screening via Information-Theoretic Optimization

    Jun 4, 2026Xueyang Wu, Siyuan Liu, Kezhuo Yang +1Audio Representation LearningDepression Detection

  3. Probing Spatial Structure in Pretrained Audio Representations

    Jun 4, 2026Chuyang Chen, Sivan Ding, Adrian S. Roman +1Audio Representation LearningRepresentation Probing

  4. CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding

    Jun 3, 2026Eugene Kwek, Feng Liu, Rui Zhang +1Audio Token CompressionAudio Representation Learning

  5. UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception

    May 29, 2026Yuhan Song, Linhao Zhang, Aiwei Liu +6Audio Representation LearningAudio Understanding

  6. Extracting accent features in spoken Brazilian Portuguese without sociolinguistic labels

    May 28, 2026Pedro H. L. Leite, Pedro Benevenuto Valadares, Luiz W. P. BiscainhoAudio Representation LearningSpeech Processing

  7. HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding

    May 28, 2026Bohan Li, Shi Lian, Hankun Wang +6Audio Representation LearningSpeech Foundation Models

  8. MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables

    May 28, 2026Sung-Lin Yeh, Wei Zhou, Gil Keren +6Audio Representation LearningAutoregressive Language Modeling

  9. LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation

    May 27, 2026Zhisheng Zhang, Xiang Li, Yixuan Zhou +3Audio Token CompressionAudio Representation Learning

  10. Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

    May 27, 2026Jiahao Mei, Heinrich Dinkel, Yadong Niu +7Text-to-Audio GenerationAudio Representation Learning

  11. MERIT: Learning Disentangled Music Representations for Audio Similarity

    May 26, 2026Abhinaba Roy, Junyi Liang, Dorien HerremansDisentangled Representation LearningAudio Representation Learning

  12. StreamSplit: Continuous Audio Representation Learning via Uncertainty-Guided Adaptive Splitting

    May 26, 2026Minh K. Quan, Pubudu N. PathiranaContrastive LearningAudio Representation Learning

  13. SAME: A Semantically-Aligned Music Autoencoder

    May 18, 2026Julian D. Parker, Zach Evans, CJ Carr +4Audio Representation LearningNeural Audio Codecs

  14. SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning

    May 14, 2026KiHyun Nam, Jungwoo Heo, Siu Bae +2Audio Representation LearningSpeaker Verification

  15. AudioMosaic: Contrastive Masked Audio Representation Learning

    May 14, 2026Hanxun Huang, Qizhou Wang, Xingjun Ma +3Audio Representation LearningSelf-Supervised Pre-Training

  16. Exploring Token-Space Manipulation in Latent Audio Tokenizers

    May 11, 2026Francesco Paissan, Luca Della Libera, Mirco Ravanelli +1Audio Representation LearningNeural Audio Codecs

  17. AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling

    May 11, 2026Jiacheng Shi, Hongfei Du, Xinyuan Song +3Audio Representation LearningNeural Audio Codecs

  18. Voice Biomarkers for Depression and Anxiety

    May 11, 2026Oleksii Abramenko, Noah D. Stein, Colin VazAudio Representation LearningDepression Detection

  19. TARNet: A Temporal-Aware Multi-Scale Architecture for Closed-Set Speaker Identification

    May 8, 2026Yassin Terraf, Youssef IraqiAudio Representation LearningTemporal Convolutional Networks

  20. WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling

    May 7, 2026Guanrou Yang, Tian Tan, Qian Chen +12Audio Representation LearningTTS Synthesis

  21. Benchmarking LLMs on the Massive Sound Embedding Benchmark (MSEB)

    May 6, 2026Cyril Allauzen, Tom Bagby, Georg Heigold +2Audio-Language Model EvaluationLLM Evaluation

  22. PHALAR: Phasors for Learned Musical Audio Representations

    May 5, 2026Davide Marincione, Michele Mancusi, Giorgio Strano +4Audio Representation LearningRepresentation Learning

  23. Shao: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation

    May 3, 2026Jiafeng Liu, Yuanliang Dong, Hongjia Liu +8Text-to-Music GenerationAudio Representation Learning