Audio Tokenizers

Momentum

6 papers in the last four weeks, up 100% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 36

All topics
CardsList
  1. Q-SPT: Learnable Query-Based Compression for Low-Frame-Rate Speech Tokenization

    Oct 1, 2026Jeeyoung Yun, Seohwan Yun, Sungwoong KimNeural Speech CodecsAudio Tokenizers

  2. Multi-Rate Bandwidth Extension by Token Completion in Neural Audio Codecs

    Sep 29, 2026Benoît Ginies, Olivier Fercoq, Gaël RichardNeural Audio CodecsAudio Tokenizers

  3. UNITE-AUDIO: Joint Learning of Continuous Tokenization and Latent Flow Matching for Text-to-Audio Generation

    Sep 23, 2026Runwu Shi, Kai Li, Yujin Wang +8Modern Generative Audio ModelsAudio Tokenizers

  4. Listen, Critique, and Refine: RL-Based Self-Refinement for Instruction-Following Speech Synthesis

    Sep 21, 2026Chee-En Yu, Yi-Cheng Lin, Sung-Feng Huang +4Speech SynthesisLarge Audio Language Models

  5. TokenMapper: A Step Toward Interoperable Speech Token Translation

    Sep 14, 2026Tal Kozakov, Tal Rosenwein, Eliya NachmaniAudio TokenizersSpeech Translation

  6. Stride-k Subsampling: Train-Free Audio Token Reduction for Whisper

    Aug 31, 2026Chanhee Cho, Junhyuk Choi, Bugeun KimAudio TokenizersSubsampling

  7. Pitch Contour Tokenization using VQ-VAE and Its Application on Korean Traditional Music Analysis

    Aug 11, 2026Seonguk Ju, Seola Cho, Sooin Chung +2Audio TokenizersVector-Quantized Variational Autoencoder

  8. Agogic: Performance-Timed Music Tokens for LLM-Native Text-to-Symbolic-Music Generation

    Aug 4, 2026Junhao Chen, Mingjin Chen, Jingjia Mao +12Text-To-MusicAudio Tokenizers

  9. Allocation Before Ranking: Decoupled Token Compression for OmniLLMs

    Aug 3, 2026Zhenghui Guo, Yilin Yang, Yuanbin Man +5Token CompressionData Compression Methods

  10. OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

    Jul 28, 2026Haoyang Huang, Wenjie Huang, Tianqi Xu +14Token CompressionAudio Tokenizers

  11. From Semantics to Readout: Mechanistic Understanding of Audio Tokens after Fine-Tuning for Temporal Audio Grounding

    Jul 28, 2026Yujian Ma, Jinqiu Sang, Ruizhe Li +2Large Audio Language ModelsAudio Tokenizers

  12. Content is What Remains: Invariant Speech Tokenization from Parallel Utterances

    Jul 21, 2026Laurin Wagner, Bernhard Thallinger, Miroslav Stankovic +1Audio TokenizersSpeaker

  13. Qwen-Music Technical Report

    Jul 13, 2026Jin Xu, Kangdi Wang, Ruibin Yuan +24Dance-To-Music GenerationAudio Tokenizers

  14. GigaChat Audio: Time-aware Large Audio Language Model

    Jul 11, 2026Aleksandr Kutsakov, Mariia Sadovina, Georgii Gospodinov +4Large Audio Language ModelsText-To-Audio

  15. Event-Based Token Sequences for Audio-Conditioned Music-Game Level Modeling

    Jul 10, 2026Ke Zhang, Chu-Hsuan Hsueh, Kokolo IkedaSymbolic Music GenerationAudio Tokenizers

  16. TokAN: Accent Normalization Using Self-Supervised Speech Tokens

    Jul 4, 2026Qibing Bai, Shuai Wang, Yuhan Du +3Audio TokenizersSelf-Supervised Speech Models

  17. AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

    Jun 29, 2026Kien T. Pham, I Chieh Chen, Qifeng Chen +1Audio-Video GenerationAudio Tokenizers

  18. wav2tok 2.0: Scalable Audio Tokenization Maintaining Explicit Pairwise Token Alignment for Efficient Audio Retrieval

    Jun 25, 2026Adhiraj Banerjee, Vipul AroraAudio TokenizersDiscrete Speech Representations

  19. Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment

    Jun 11, 2026Xiang Li, Yixuan Zhou, Jingran Xie +2Neural Speech CodecsNeural Codecs

  20. Acoustic Cue Alignment in Audio Language Models for Speech Emotion Recognition

    Jun 5, 2026Iosif Tsangko, Andreas Triantafyllopoulos, Björn W. SchullerAudio TokenizersEmotion Recognition

  21. F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation

    Jun 4, 2026Dinghao Zhou, Xingchen Song, Di Wu +3Audio TokenizersNeural Audio

  22. CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding

    Jun 3, 2026Eugene Kwek, Feng Liu, Rui Zhang +1Audio TokenizersInformation Bottleneck

  23. UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception

    May 29, 2026Yuhan Song, Linhao Zhang, Aiwei Liu +6Audio TokenizersAcoustic Latent Space

  24. HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding

    May 28, 2026Bohan Li, Shi Lian, Hankun Wang +6Audio TokenizersTokenizer

  25. LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation

    May 27, 2026Zhisheng Zhang, Xiang Li, Yixuan Zhou +3Audio TokenizersAudio Understanding

  26. Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation

    May 15, 2026Yuqing Cheng, Xingyu Ma, Guochen Yu +1Audio Tokenizers

  27. Exploring Token-Space Manipulation in Latent Audio Tokenizers

    May 11, 2026Francesco Paissan, Luca Della Libera, Mirco Ravanelli +1Audio TokenizersNeural Audio Codecs

  28. PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization

    May 7, 2026Adhiraj Banerjee, Vipul AroraAudio TokenizersAutoregressive Token Prediction

  29. BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps

    Apr 21, 2026Lekai Qian, Haoyu Gu, Jingwei Zhao +1Symbolic Music GenerationAudio Tokenizers

  30. Speech Codec Probing from Semantic and Phonetic Perspectives

    Mar 11, 2026Xuan Shi, Chang Zeng, Tiantian Feng +3Audio TokenizersNeural Speech Codecs

  31. Harmonic-Percussive Disentangled Neural Audio Codec for Bandwidth Extension

    Nov 26, 2025Benoît Giniès, Xiaoyu Bie, Olivier Fercoq +1Neural Audio CodecsAudio Tokenizers