Audio Tokenization

Latest papers 33

All topics
CardsList
  1. Q-SPT: Learnable Query-Based Compression for Low-Frame-Rate Speech Tokenization

    Oct 1, 2026Jeeyoung Yun, Seohwan Yun, Sungwoong KimAudio Token CompressionNeural Audio Codecs

  2. Multi-Rate Bandwidth Extension by Token Completion in Neural Audio Codecs

    Sep 29, 2026Benoît Ginies, Olivier Fercoq, Gaël RichardAudio Representation LearningNeural Audio Codecs

  3. Interpreting and Evaluating Dynamic-Rate Speech Codec Boundaries

    Sep 29, 2026Han Wang, Jiaqi Li, Yingda Shen +2Neural Audio CodecsAudio Tokenization

  4. UNITE-AUDIO: Joint Learning of Continuous Tokenization and Latent Flow Matching for Text-to-Audio Generation

    Sep 23, 2026Runwu Shi, Kai Li, Yujin Wang +8Text-to-Audio GenerationAudio Representation Learning

  5. Discrete vs. Continuous: A Comprehensive Study of Unified Audio Understanding in LALMs

    Sep 19, 2026Jing Peng, Zichao Nie, Zhisheng Zhang +2Audio-Language Model EvaluationAudio Representation Learning

  6. TokenMapper: A Step Toward Interoperable Speech Token Translation

    Sep 14, 2026Tal Kozakov, Tal Rosenwein, Eliya NachmaniNeural Audio CodecsAudio Tokenization

  7. StreamAlign: Streaming Text-Aligned Speech Tokenization

    Sep 9, 2026Kang-wook Kim, Jinyoung Park, Jinsoo Kim +3Audio TokenizationSpeech Language Models

  8. BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling

    Sep 1, 2026Xin Zhang, Lin Li, Chuanbo Liu +2Neural Audio CodecsVector Quantization

  9. Language-Statistical Analysis of Neural Audio Codec Tokens Across Architectures, Corpora, and Noise Conditions

    Aug 31, 2026Joonyong Park, Shinnosuke Takamichi, David M. Chan +3Neural Audio CodecsResidual VQ

  10. Pitch Contour Tokenization using VQ-VAE and Its Application on Korean Traditional Music Analysis

    Aug 11, 2026Seonguk Ju, Seola Cho, Sooin Chung +2Audio Representation LearningVector-Quantized Variational Autoencoder

  11. ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure

    Aug 8, 2026Zixiang Wan, Xusheng Yang, Zheng Wang +1Neural Audio CodecsAudio Tokenization

  12. KVAE: Family of Tokenizers for Multimodal Generative Models

    Aug 6, 2026Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov +11Variational AutoencodersAudio Token Compression

  13. Content is What Remains: Invariant Speech Tokenization from Parallel Utterances

    Jul 21, 2026Laurin Wagner, Bernhard Thallinger, Miroslav Stankovic +1Audio TokenizationSelf-Supervised Speech Representation Learning

  14. Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models

    Jul 18, 2026Ye Lu, Yihan Yan, Zhaoyang Zhang +4Adversarial AttacksPrivacy Leakage in Language Models

  15. Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization

    Jul 5, 2026Ryota Komatsu, Kota Kawakita, Takuma Okamoto +1Audio TokenizationSelf-Supervised Speech Representation Learning

  16. Neural Audio Codec with Adjustable Token Temporal Resolution Using Sampling-Frequency-Independent Convolutional Layers

    Jul 2, 2026Tomohiko Nakamura, Wataru Nakata, Kanami Imamura +1Neural Audio CodecsAudio Tokenization

  17. wav2tok 2.0: Scalable Audio Tokenization Maintaining Explicit Pairwise Token Alignment for Efficient Audio Retrieval

    Jun 25, 2026Adhiraj Banerjee, Vipul AroraAudio Representation LearningSpeech Processing

  18. End-to-End Training for Discrete Token LLM based TTS System

    Jun 8, 2026Changfeng Gao, Yong Ren, Jun Yuan +3TTS SynthesisSpeech Processing

  19. TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech

    Jun 8, 2026Yejin Lee, Junwon Moon, Hyoeun Kim +3Efficient Transformer InferenceAudio Token Compression

  20. Probing Token Spaces under Generator Shift in AI-Generated Music Detection

    Jun 7, 2026Joonyong Park, Jungwoo Kim, Junyoung Koh +1Audio Representation LearningAudio Deepfake Detection

  21. Leveraging Soft Distributions of SSL-Derived Discrete Speech Tokens for Downstream Inference

    Jun 5, 2026Kentaro Onda, Satoru Fukayama, Daisuke Saito +1Automatic Speech RecognitionAudio Tokenization

  22. F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation

    Jun 4, 2026Dinghao Zhou, Xingchen Song, Di Wu +3Audio Representation LearningAutoencoders

  23. CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding

    Jun 3, 2026Eugene Kwek, Feng Liu, Rui Zhang +1Audio Token CompressionAudio Representation Learning

  24. UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception

    May 29, 2026Yuhan Song, Linhao Zhang, Aiwei Liu +6Audio Representation LearningAudio Understanding

  25. HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding

    May 28, 2026Bohan Li, Shi Lian, Hankun Wang +6Audio Representation LearningSpeech Foundation Models

  26. LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation

    May 27, 2026Zhisheng Zhang, Xiang Li, Yixuan Zhou +3Audio Token CompressionAudio Representation Learning

  27. Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation

    May 15, 2026Yuqing Cheng, Xingyu Ma, Guochen Yu +1Neural Audio CodecsAutoregressive Language Modeling

  28. Exploring Token-Space Manipulation in Latent Audio Tokenizers

    May 11, 2026Francesco Paissan, Luca Della Libera, Mirco Ravanelli +1Audio Representation LearningNeural Audio Codecs

  29. PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization

    May 7, 2026Adhiraj Banerjee, Vipul AroraAudio TokenizationSelf-Supervised Speech Representation Learning

  30. LLM-Codec: Neural Audio Codec Meets Language Model Objectives

    Apr 20, 2026Ho-Lam Chung, Yiming Chen, Hung-yi LeeNeural Audio CodecsMulti-Token Prediction

  31. Speech Codec Probing from Semantic and Phonetic Perspectives

    Mar 11, 2026Xuan Shi, Chang Zeng, Tiantian Feng +3Audio Representation LearningNeural Audio Codecs