Audio Token Compression

Latest papers 22

All topics
CardsList
  1. Q-SPT: Learnable Query-Based Compression for Low-Frame-Rate Speech Tokenization

    Oct 1, 2026Jeeyoung Yun, Seohwan Yun, Sungwoong KimAudio Token CompressionNeural Audio Codecs

  2. Audio Token Attention Is Predictable Before the Language Model Runs

    Sep 30, 2026Kyoungjun Park, Yunzhe Li, Lili QiuAudio Token CompressionAudio Understanding

  3. OmniRoute: Mapping Temporal Semantic Evidence to Audio-Visual Token Budgets for Efficient Omnimodal Large Language Models

    Sep 29, 2026Yuchen Deng, Zidang Cai, Feidiao Yang +4Efficient Multimodal InferenceAudio Token Compression

  4. Joint Analysis of Latent Dimensionality and Frame Rate in Continuous Audio Encoders

    Sep 24, 2026Kyudan Jung, Sehyun Lee, Son-ha Jo +2Audio Token CompressionAudio Representation Learning

  5. LACE: Layer-Wise Compression for Dynamic Frame Rate Codecs

    Sep 15, 2026Thanapat Trachu, Samuele Cornell, William Chen +1Audio Token CompressionNeural Audio Codecs

  6. ZipCodec: Ultra-Low-Frame-Rate Streaming Speech Coding

    Sep 12, 2026Luca Della Libera, Cem Subakan, Mirco RavanelliAudio Token CompressionNeural Audio Codecs

  7. Stride-k Subsampling: Train-Free Audio Token Reduction for Whisper

    Aug 31, 2026Chanhee Cho, Junhyuk Choi, Bugeun KimAudio Token CompressionAutomatic Speech Recognition

  8. Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs

    Aug 9, 2026Kyeongyoon Lee, Hongyeob Kim, Youngeun Kim +1Efficient Multimodal InferenceAudio Token Compression

  9. KVAE: Family of Tokenizers for Multimodal Generative Models

    Aug 6, 2026Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov +11Variational AutoencodersAudio Token Compression

  10. OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

    Aug 4, 2026Wanshun Su, Yang Shi, Feihu Liu +10Efficient Multimodal InferenceAudio Token Compression

  11. Allocation Before Ranking: Decoupled Token Compression for OmniLLMs

    Aug 3, 2026Zhenghui Guo, Yilin Yang, Yuanbin Man +5Audio Token CompressionUnified Multimodal Models

  12. OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

    Jul 28, 2026Haoyang Huang, Wenjie Huang, Tianqi Xu +14Efficient Multimodal InferenceAudio Token Compression

  13. OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models

    Jul 25, 2026Jinsen Su, Yongdong Luo, Yuexiao Ma +3Efficient Multimodal InferenceAudio Token Compression

  14. TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech

    Jun 8, 2026Yejin Lee, Junwon Moon, Hyoeun Kim +3Efficient Transformer InferenceAudio Token Compression

  15. CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding

    Jun 3, 2026Eugene Kwek, Feng Liu, Rui Zhang +1Audio Token CompressionAudio Representation Learning

  16. LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation

    May 27, 2026Zhisheng Zhang, Xiang Li, Yixuan Zhou +3Audio Token CompressionAudio Representation Learning

  17. OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

    May 12, 2026Yuchen Deng, Zidang Cai, Hai-Tao Zheng +3Audio-Visual UnderstandingEfficient Multimodal Inference

  18. HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

    Apr 26, 2026Peize He, Yaodi Luo, Xiaoqian Liu +7Audio Token CompressionSelf-Attention

  19. Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy

    Sep 22, 2025Geewook Kim, Minjoon SeoVLM EvaluationAudio-Visual Understanding