Unigram Tokenizer

Latest papers 44

All topics
CardsList
  1. Forking: Sudden Overfitting Under Replay

    Sep 30, 2026Shanbin Yu, Shaoyang Guo, Haoran Zhao +2OverfittingCatastrophic Forgetting

  2. FactorEngram: Factorized N-gram Memory with Basis-Level Gating for Language Models

    Sep 28, 2026Bowen Yang, Jingbo Zhou, Qinghong Miao +1Unigram TokenizerLarge Language Model Memory

  3. Recursive LLM Degradation in Biomedical Question Answering: A Cross-Generation Study

    Sep 28, 2026Bibek Bhandari, Kshitij LingthepBiomedical TextSynthetic Data

  4. Structure Before Sampling: Community-Aware Core-Set Selection for Data-Efficient Text-to-Speech

    Sep 21, 2026Mizbaul Haque Maruf, Muhammad Nur YanhaonaGrapheme-To-PhonemeText Corpora

  5. Contributions to the hierarchy of probabilistic languages

    Sep 20, 2026Lothar Sebastian Krapp, Remo NitschkeContext-Free GrammarsProbabilistic Model

  6. To Each Language Its Tokenizer: Modular Tokenizers for Efficient Multilingual LLMs

    Sep 14, 2026Franck Signe, Hippolyte Pilchen, François Yvon +1Multilingual Language ModelsTokenizer

  7. SynthSentry: Detecting Synthetic Data Contamination in Language Model Training Data

    Sep 14, 2026Praveen Kumar Myakala, Ravichandra Namburi, Sowmya Keragodu Jayaramu +1Synthetic DataTraining Data

  8. Semantic Fibers and Cross-Gram Interference: A Calculus of Safety Drift in Overcomplete Representations

    Sep 14, 2026Mohammed Ahnouch, Lotfi ElaachackMultilingual SafetyRepresentation-Level Misalignment

  9. Lngram v2: Latent N-Gram Memory with Interpretable Discrete Representations

    Sep 3, 2026Yunao Zheng, Bin Wen, Xiaojie Wang +12Unigram TokenizerLanguage Model Computes

  10. AI Watermark Evidence Fails Forensic Readiness: An Empirical Evaluation

    Jul 17, 2026Saifur Rahman Tamim, Amir Labib KhanLarge Language Model WatermarksWatermarks

  11. Dzongkha Next Word Prediction System

    Jul 13, 2026Prerna Chhetri, Tenzin Yoezer, Phuntsho Wangmo +1Unigram TokenizerBangla

  12. Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG

    Jul 3, 2026Haotian Zhou, Weiran Huang, Siqi Liu +3Language PairsUnigram Tokenizer

  13. Induction Heads Interpolate N-Grams

    Jul 2, 2026Francesco D'Angelo, Oguz Kaan Yuksel, Swathi Shree Narashiman +1Transformer ArchitecturesIn-Context Learning

  14. Hamm-Grams: An Algorithm for Mining Regular Expressions of Bytes

    Jul 1, 2026Derek Everett, Edward Raff, James HoltMalwareUnigram Tokenizer

  15. A Fusion-Aware Two-Stage Framework for Mispronunciation Detection and Diagnosis in Low-Resource Modern Standard Arabic

    Jun 23, 2026Jing Yang, Shuqing Zhang, Yongyi Deng +5Arabic Natural Language ProcessingArabic

  16. Augmenting Molecular Language Models with Local nn-gram Memory

    Jun 10, 2026Xinni Zhang, Zijing Liu, He Cao +2Unigram TokenizerLanguage Modeling

  17. NGram-MoSE: Efficient Remote Sensing Super-Resolution via N-Gram Context and Mixture-of-Experts

    Jun 7, 2026Yun-Hsuan Huang, Trong-An Bui, Chih-Hung ChuangHyperspectral Image Super-ResolutionRemote Sensing

  18. Tensorizing Engram: Sharing Latents Across N-Gram Embeddings is Beneficial in LLMs

    Jun 6, 2026Wuyang Zhou, Yuxuan Gu, Giorgos Iacovides +3Unigram TokenizerToken Embeddings

  19. Speculative Decoding Across Languages

    May 28, 2026Nirajan Paudel, Michael Ginn, Luc De Nardi +1Speculative DecodingMultilingual

  20. Lngram: N-gram Conditional Memory in Latent Space

    May 24, 2026Yunao Zheng, Guoyang Xia, Xiaojie Wang +1Efficient Long-Context InferenceLanguage Modeling

  21. Tokenization with Split Trees

    May 21, 2026Craig W. Schmidt, Michael Krumdick, Adam Wiemerslage +4Subword TokenizationUnigram Tokenizer

  22. Memory Grafting: Scaling Language Model Pre-training via Offline Conditional Memory

    May 20, 2026Runxi Cheng, Yuchen Guan, Yongxian Wei +7Large Language Model MemoryLarge Language Model Pretraining

  23. NGM: A Plug-and-Play Training-Free Memory Module for LLMs

    May 16, 2026Yuwen Qu, Wenhui Dong, Chenyang Si +1Large Language Model MemoryUnigram Tokenizer

  24. COVID-19 Infodemic. Understanding content features in detecting fake news using a machine learning approach

    May 7, 2026Vimala Balakrishnan, Lee Zing Hii, Eric LaporteFake News DetectionFake News

  25. Cascade Token Selection for Transformer Attention Acceleration

    May 4, 2026Stephen J. ThomasTransformer AttentionLinear Attention

  26. Beyond N-gram: Data-Aware X-GRAM Extraction for Efficient Embedding Parameter Scaling

    Apr 23, 2026Yilong Chen, Yanxi Xie, Zitian Gao +10Unigram TokenizerMemory-Augmented Framework

  27. Promoting Simple Agents: Ensemble Methods for Event-Log Prediction

    Apr 23, 2026Benedikt Bollig, Matthias Függer, Thomas Nowak +1EnsembleAutomata

  28. Tokenization vs. Augmentation: A Systematic Study of Writer Variance in IMU-Based Online Handwriting Recognition

    Feb 25, 2026Jindong Li, Dario Zanca, Vincent Christlein +4HandwritingData Augmentation

  29. Provable Benefit of SignGD: A Minimal Model Under Heavy-Tailed Class Imbalance

    Nov 30, 2025Robin Yadav, Shuo Xie, Tianhao Wang +1Stochastic Gradient DescentSignsgd

  30. Predicting the Emergence of Induction Heads in Language Model Pretraining

    Nov 21, 2025Tatsuya Aoyama, Ethan Gotlieb Wilcox, Nathan SchneiderLarge Language Model PretrainingIn-Context Learning

  31. What Language is This? Ask Your Tokenizer

    Date pendingClara Meister, Ahmetcan Yavuz, Pietro Lesci +1TokenizerLanguage Pairs