Tokenizer Adaptation

Momentum

1 paper in the last four weeks, with none the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 17

All topics
CardsList
  1. BuzzASR: A Swarm of 100+ Monolingual Speech Recognition Models

    Sep 9, 2026Shivam Singh, Aditya Yadavalli, Catherine Arnett +1Speech Foundation ModelsAutomatic Speech Recognition

  2. Tokenizer Transplantation: Mitigating Autoregressive Collapse in Edge-Efficient Bengali ASR

    Jul 10, 2026Sanjid Hasan, Md. Abdur RahmanAutomatic Speech RecognitionLow-Resource Speech Recognition

  3. LangMAP: A Language-Adaptive Approach to Tokenization

    Jun 22, 2026Clara Meister, Suchir Salhan, Andrzej Szablewski +3Multilingual Language ModelsTokenizer Adaptation

  4. AdaTok: Self-Budgeting Image Tokenization with Quality-Preserving Dynamic Tokens

    Jun 5, 2026Xiaocheng Lu, Yuxi Chen, Jie Zhang +5Image TokenizationVisual Tokenization

  5. Modular Monolingual Adaptation using Pretrained Language Models

    Jun 4, 2026Nalin Kumar, Ondřej DušekLow-Resource Language ProcessingTokenizer Adaptation

  6. F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation

    Jun 4, 2026Dinghao Zhou, Xingchen Song, Di Wu +3Audio Representation LearningAutoencoders

  7. Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering

    Jun 1, 2026Dongxing Mao, Jinpeng Wang, Jiahao Tang +6Image TokenizationVisual Tokenization

  8. Adapting Multilingual Embedding Models to Turkish via Cross-Lingual Tokenizer Surgery and Offline Distillation

    May 28, 2026M. Ali Bayram, Banu Diri, Savaş YıldırımMultilingual Language ModelsSentence Embeddings

  9. Learning Faster with Better Tokens: Parameter-Efficient Vocabulary Adaptation for Specialized Text Summarization

    May 17, 2026Gunjan Balde, Soumyadeep Roy, Mainack Mondal +1Domain-Adaptive PretrainingText Summarization

  10. TokAlign++: Advancing Vocabulary Adaptation via Better Token Alignment

    May 13, 2026Chong Li, Yingzhuo Deng, Wen Yang +2Multilingual Language ModelsTokenizer Adaptation

  11. From Token to Token Pair: Efficient Prompt Compression for Large Language Models in Clinical Prediction

    May 12, 2026Mingcheng Zhu, Zhiyao Luo, Yu Liu +1LLM CompressionClinical Prediction

  12. Adapting TrOCR for Printed Tigrinya Text Recognition: Word-Aware Loss Weighting for Cross-Script Transfer Learning

    Apr 22, 2026Yonatan Haile Medhanie, Yuanhua NiTransfer LearningOptical Character Recognition

  13. SinLlama -- A Large Language Model for Sinhala

    Aug 12, 2025H. W. K. Aravinda, Rashad Sirajudeen, Samith Karunathilake +3Language Model PretrainingMultilingual Language Models

  14. Vikhr: The Family of Open-Source Instruction-Tuned Large Language Models for Russian

    May 22, 2024Aleksandr Nikolich, Konstantin Korolev, Sergei Bratchikov +2Language Model PretrainingMultilingual Language Models