Efficient Language Model Training

Latest papers 109

All topics
CardsList
  1. Towards Looped Models Done Right, Part II: Rethinking at Fixed Points

    Oct 5, 2026Benhao Huang, Chufan Shi, Junlin Chen +4Efficient Language Model TrainingRecurrent Transformers

  2. Beyond State-of-the-Art: Standardising Environmental Impact Metrics for AI Research

    Oct 1, 2026Lachlan McGinness, Dan Pagendam, Robert OffnerLLM Inference EfficiencyEnergy-Efficient ML

  3. Closing the Loop: Practical Training Recipes for Looped Language Models

    Sep 30, 2026Andrei Marchenko, Viacheslav Bezrukov, Oleg Kashurin +5Efficient Language Model TrainingLLM Training

  4. It's All Training: A Fully Synthetic Single-Stage Recipe for LLMs

    Sep 29, 2026Pierre-Carl Langlais, Pieter Delobelle, Yannick Detrois +7Language Model PretrainingSynthetic Data Pretraining

  5. MeqMuon: Matrix-Equilibrating Muon for LLM Pretraining

    Sep 28, 2026Chang-Wei Shi, Xu Wang, Wu-Jun LiLanguage Model PretrainingEfficient Language Model Training

  6. SOLO: Pretraining Billion-Parameter Language Models with Shared-Output Local Learning

    Sep 28, 2026Bojian Yin, Shurong Wang, Yuqi Pan +1Language Model PretrainingEfficient Language Model Training

  7. LionMuon: Alternating Spectral and Sign Descent for Efficient Training

    Sep 28, 2026Arman Bolatov, Artem Riabinin, Nikita Kornilov +4Stochastic OptimizationLanguage Model Pretraining

  8. No Free Efficiency: Revisiting the Trade-off Between Training Efficiency and Model Vulnerability

    Sep 27, 2026Yiyong Liu, Jun Sakuma, Michael Backes +1Adversarial RobustnessEfficient Language Model Training

  9. The Life of a Token: from Words to Bits on the Wire

    Sep 17, 2026Davide Avesani, Pengwenlong Gu, Sotiris Skaperas +1Communication-Efficient Distributed TrainingHigh-Performance Computing

  10. Size Matters: Foundation Model for Czech HTML documents

    Sep 16, 2026Martin Dvořák, Vít Tlustoš, Artyom Voronin +4Language Model PretrainingEfficient Language Model Training

  11. Data-Efficient Language Modeling: From Frontier Advancement to Principle-Guided Model Improvement

    Sep 12, 2026Shuxing Yang, Kaihao Zhu, Junjie Yang +13Efficient Language Model TrainingLanguage Modeling

  12. Structural priors for data-efficient language learning

    Sep 12, 2026Yana Veitsman, Jonas Mayer Martins, Jonathan Lautenschlager +1Language Model PretrainingNeural Network Initialization

  13. Parallelism Strategy Chaining for Fast Training Convergence

    Sep 7, 2026Minchul Kang, Changyong Shin, Younghun Go +4Efficient Language Model TrainingLLM Training

  14. Toppling the Hierarchy in Byte-level Language Modeling

    Aug 31, 2026Lukas Edman, Alexander FraserEfficient Language Model TrainingByte-Level Language Model

  15. Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090

    Aug 27, 2026Kairong Luo, Jiarui Cui, Yaorui Yin +8Language Model PretrainingLanguage Model Scaling Laws

  16. Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model

    Aug 13, 2026Mohammed Sabry, Sean Augenstein, Keith Rush +1Language Model PretrainingEfficient Language Model Training

  17. LazyTrain: Limited-resource Allocation toward Zero-waste Yield Optimization in Large Language Model Training

    Aug 12, 2026Xiaojun Wu, Cehao Yang, Honghao Liu +5Efficient Language Model TrainingLLM Training

  18. TELLME: Test-Enhanced Learning for Language Model Enrichment

    Aug 12, 2026Minjun Kim, Inho Won, Hyeonseok Lim +6Domain-Adaptive PretrainingEfficient Language Model Training