Byte-Pair Encoding

Momentum

6 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 29

All topics
CardsList
  1. Preserving Morphemes: Morphology-Guided Pre-Tokenization for Nepali

    Sep 27, 2026Kalash Shrestha, Nikhil PradhanByte-Pair EncodingTokenizer

  2. Objective vs. Search: Decomposing What Makes a Good Tokeniser

    Sep 16, 2026Ahmetcan Yavuz, Clara Meister, Tiago PimentelByte-Pair EncodingTokenizer

  3. To Each Language Its Tokenizer: Modular Tokenizers for Efficient Multilingual LLMs

    Sep 14, 2026Franck Signe, Hippolyte Pilchen, François Yvon +1Multilingual Language ModelsTokenizer

  4. Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics

    Aug 11, 2026Qingjie Zhang, Ziqi Tang, Jie Zhang +7Text CorporaByte-Pair Encoding

  5. Disentangling Language Modeling and Boundaries

    Aug 4, 2026Mykola HaltiukByte-Pair EncodingLanguage Modeling

  6. Pruned BPE: Post-training Visibility Pruning and Token Reallocation for Byte Pair Encoding

    Aug 1, 2026Kenny ShaoByte-Pair EncodingSubword Tokenization

  7. Writing-System-Level Tokenizer Adaptation for Byte-Level BPE

    Aug 1, 2026Bohdan DidenkoByte-Pair EncodingTokenizer

  8. Joint Optimization for Greedy Longest-match Tokenization

    Jul 25, 2026Adhiraj Singh, Deepanshu Mody, Ghina Al Shdaifat +4Byte-Pair EncodingToken Compression

  9. BHARATI: Morphology-Aware Tokenizers for Classical Indian Languages with Subword Fertility Analysis

    Jul 25, 2026Poornima Kumaresan, Pavithra Muruganantham, Lakshmi Rajendran +1Subword TokenizationIndian Languages

  10. JPEG AIC2026: A large-scale dataset for fine-grained assessment of image coding

    Jul 24, 2026Mohsen Jenadeleh, Jon Sneyers, João Ascenso +8Learned Image CompressionImage Quality Assessment

  11. Tokenizer Transplantation: Mitigating Autoregressive Collapse in Edge-Efficient Bengali ASR

    Jul 10, 2026Sanjid Hasan, Md. Abdur RahmanAutomatic Speech RecognitionBangla

  12. DNA Language Models: An Assessment of Pre-Training for Fine-Tuning Tasks

    Jun 29, 2026Romain Karpinsky, Julien Mozziconacci, Mickaël DelceyGenerative Pretrained TransformersTransformer Architectures

  13. PortBERT: Navigating the Depths of Portuguese Language Models

    Jun 1, 2026Raphael Scheible-Schmitt, Henry He, Armando B. MendesBert-Based ModelsPortuguese

  14. Incremental BPE Tokenization

    May 29, 2026Shenghu Jiang, Ruihao GongByte-Pair EncodingTokenizer

  15. Pretraining Language Models with Subword Regularization: An Empirical Study of BPE Dropout in Low-Resource NLP

    May 13, 2026Ruan Visser, Trienko Grobler, Marcel DunaiskiSubword TokenizationPretraining

  16. From Token to Token Pair: Efficient Prompt Compression for Large Language Models in Clinical Prediction

    May 12, 2026Mingcheng Zhu, Zhiyao Luo, Yu Liu +1Multi-Token PredictionElectronic Health Records

  17. MambaNetBurst: Direct Byte-level Network Traffic Classification without Tokenization or Pretraining

    May 11, 2026Gayan K. Kulatilleke, Siamak Layeghy, Mahsa Baktashmotlagh +1Mamba-Based ModelsMalware

  18. Flashback: A Reversible Bilateral Run-Peeling Decomposition of Strings

    Apr 29, 2026Thomas Konstantinovsky, Gur YaariByte-Pair EncodingDecomposition

  19. Adapting TrOCR for Printed Tigrinya Text Recognition: Word-Aware Loss Weighting for Cross-Script Transfer Learning

    Apr 22, 2026Yonatan Haile Medhanie, Yuanhua NiHandwritten Text RecognitionOptical Character Recognition

  20. Understanding Secret Leakage Risks in Code LLMs: A Tokenization Perspective

    Apr 20, 2026Meifang Chen, Zhe Yang, Huang Nianchen +4Data LeakageToken-Level Entropy

  21. Parity-Aware Byte-Pair Encoding: Improving Cross-lingual Fairness in Tokenization

    Aug 6, 2025Negar Foroutan, Clara Meister, Debjit Paul +4Byte-Pair EncodingCross-Lingual Consistency