Subword Tokenization

Momentum

8 papers in the last four weeks, against 1 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 52

All topics
CardsList
  1. Counting and Min-Cost Encoding for Tokenization in Large Language Models

    Oct 1, 2026Shuming Shi, Xiang Zhang, Hao Yu +7Subword Tokenization

  2. Preserving Morphemes: Morphology-Guided Pre-Tokenization for Nepali

    Sep 27, 2026Kalash Shrestha, Nikhil PradhanLanguage Model PretrainingLow-Resource Language Processing

  3. Objective vs. Search: Decomposing What Makes a Good Tokeniser

    Sep 16, 2026Ahmetcan Yavuz, Clara Meister, Tiago PimentelSubword TokenizationByte-Pair Encoding

  4. Right Tool, Right Job: Native-Language Evaluation, Tokenizer Sensitivity, and Methodological Findings from a French-Only BabyLM

    Sep 15, 2026Adam Zachary Wasserman, David BeaucheminLLM EvaluationCross-Lingual Representation Alignment

  5. Pruned BPE: Post-training Visibility Pruning and Token Reallocation for Byte Pair Encoding

    Aug 1, 2026Kenny ShaoToken PruningSubword Tokenization

  6. TokTier: Exact Stateful CPU+GPU Tokenization for Agentic LLM Serving

    Jul 31, 2026Zhenyu Zhang, Zhichao CaoLLM ServingLLM Inference Acceleration

  7. Joint Optimization for Greedy Longest-match Tokenization

    Jul 25, 2026Adhiraj Singh, Deepanshu Mody, Ghina Al Shdaifat +4Subword Tokenization

  8. BHARATI: Morphology-Aware Tokenizers for Classical Indian Languages with Subword Fertility Analysis

    Jul 25, 2026Poornima Kumaresan, Pavithra Muruganantham, Lakshmi Rajendran +1Low-Resource Language ProcessingSubword Tokenization

  9. Tokenizing Crosslingual Homographs

    Jul 20, 2026Rotem Brillant, Yuval PinterMultilingual Language ModelsSubword Tokenization

  10. Privacy Leakage in Federated Learning in Radiology Reports: A Comparative Evaluation of Tokenizer-Driven Privacy Risks

    Jul 15, 2026Santhosh Parampottupadam, Andres Martinez, Dimitrios Bounias +3Gradient Inversion AttacksAdversarial Attacks

  11. Phonemes to the Rescue: Multilingual Tokenization Based on International Phonetic Alphabet

    Jun 18, 2026Milan Miletić, Julie Kallini, Ekaterina ShutovaMultilingual Language ModelsLow-Resource Language Processing

  12. Equity with Efficiency: An Empirical Study of Tokenizers for Multilingual Large Language Models

    Jun 13, 2026Kieron Seven Jun Wei Lee, Muhammad Reza Qorib, Andrew Ivan Soegeng +1Multilingual Language ModelsSocial Bias in Language Models

  13. Inside the LLM Word Factory

    Jun 7, 2026Benzi Busigin, Yuval PinterLanguage Model DecodingLLM Interpretability

  14. LDARNet: DNA Adaptive Representation Network with Learnable Tokenization for Genomic Modeling

    Jun 3, 2026Daria Ledneva, Denis KuznetsovHierarchical Representation LearningGenomics

  15. Incremental BPE Tokenization

    May 29, 2026Shenghu Jiang, Ruihao GongSubword TokenizationByte-Pair Encoding

  16. Tokenisation via Convex Relaxations

    May 21, 2026Jan Tempus, Philip Whittington, Craig W. Schmidt +2Token EfficiencyLinear Programming

  17. Tokenization with Split Trees

    May 21, 2026Craig W. Schmidt, Michael Krumdick, Adam Wiemerslage +4Token EfficiencySubword Tokenization

  18. Effective Context in Transformers: An Analysis of Fragmentation and Tokenization

    May 13, 2026Amirmehdi Jafari Fesharaki, Mohammadamin Rami, Aslan TchamkertenLanguage ModelingSubword Tokenization

  19. Pretraining Language Models with Subword Regularization: An Empirical Study of BPE Dropout in Low-Resource NLP

    May 13, 2026Ruan Visser, Trienko Grobler, Marcel DunaiskiLanguage Model PretrainingLow-Resource Language Processing

  20. Natural Language Processing: A Comprehensive Practical Guide from Tokenisation to RLHF

    May 5, 2026Mullosharaf K. ArabovLLM Fine-TuningLow-Resource Language Processing

  21. A Comprehensive Analysis of Tokenization and Self-Supervised Learning in End-to-End Automatic Speech Recognition applied on French Language

    May 5, 2026Thibault Bañeras-Roux, Mickael Rouvier, Jane Wottawa +1ASR EvaluationAutomatic Speech Recognition

  22. Compute Optimal Tokenization

    May 2, 2026Tomasz Limisiewicz, Artidoro Pagnoni, Srini Iyer +6Language Model Scaling LawsEfficient Language Model Training

  23. KOMBO: Korean Character Representations Based on the Combination Rules of Subcharacters

    Apr 27, 2026SungHo Kim, Juhyeong Park, Yeachan Kim +1Language ModelingSubword Tokenization

  24. Understanding Secret Leakage Risks in Code LLMs: A Tokenization Perspective

    Apr 20, 2026Meifang Chen, Zhe Yang, Huang Nianchen +4Data LeakageMemorization in Language Models

  25. Defragmenting Language Models: An Interpretability-based Approach for Vocabulary Expansion

    Apr 17, 2026Maitrey Mehta, Nishant Subramani, Zhichao Xu +2Multilingual Language ModelsSubword Tokenization

  26. Stochasticity in Tokenisation Improves Robustness

    Apr 17, 2026Sophie Steger, Rui Li, Sofiane Ennadir +4Adversarial Attacks on LLMsNeural Network Robustness

  27. MDM-Prime-v2: Binary Encoding and Index Shuffling Enable Scaling of Diffusion Language Models

    Mar 17, 2026Chen-Hao Chao, Wei-Fang Sun, Junwei Quan +2Diffusion Language ModelsSubword Tokenization

  28. Tokenization vs. Augmentation: A Systematic Study of Writer Variance in IMU-Based Online Handwriting Recognition

    Feb 25, 2026Jindong Li, Dario Zanca, Vincent Christlein +4Data AugmentationOnline Handwriting Recognition

  29. You Can Learn Tokenization End-to-End with Reinforcement Learning

    Feb 15, 2026Sam Dauncey, Roger WattenhoferSubword TokenizationLLM Training

  30. TokSuite: Measuring the Impact of Tokenizer Choice on Language Model Behavior

    Dec 23, 2025Gül Sena Altıntaş, Malikeh Ehghaghi, Brian Lester +4Subword Tokenization

  31. Less Is More: Reducing Token Counts Without Compromising Performance

    Jun 18, 2025Gyeongje Cho, Yeonkyoung So, Sangmin Lee +1LLM Inference AccelerationToken Efficiency

  32. Tokens, the oft-overlooked appetizer: Large language models, the distributional hypothesis, and meaning

    Dec 14, 2024Julia Witte Zimmerman, Denis Hudon, Kathryn Cramer +9LLM InterpretabilityDistributional Semantics