Efficient Language Model Training

Latest papers 109

All topics
CardsList
  1. Towards Looped Models Done Right, Part II: Rethinking at Fixed Points

    Oct 5, 2026Benhao Huang, Chufan Shi, Junlin Chen +4Efficient Language Model TrainingRecurrent Transformers

  2. Beyond State-of-the-Art: Standardising Environmental Impact Metrics for AI Research

    Oct 1, 2026Lachlan McGinness, Dan Pagendam, Robert OffnerLLM Inference EfficiencyEnergy-Efficient ML

  3. Closing the Loop: Practical Training Recipes for Looped Language Models

    Sep 30, 2026Andrei Marchenko, Viacheslav Bezrukov, Oleg Kashurin +5Efficient Language Model TrainingLLM Training

  4. It's All Training: A Fully Synthetic Single-Stage Recipe for LLMs

    Sep 29, 2026Pierre-Carl Langlais, Pieter Delobelle, Yannick Detrois +7Language Model PretrainingSynthetic Data Pretraining

  5. MeqMuon: Matrix-Equilibrating Muon for LLM Pretraining

    Sep 28, 2026Chang-Wei Shi, Xu Wang, Wu-Jun LiLanguage Model PretrainingEfficient Language Model Training

  6. SOLO: Pretraining Billion-Parameter Language Models with Shared-Output Local Learning

    Sep 28, 2026Bojian Yin, Shurong Wang, Yuqi Pan +1Language Model PretrainingEfficient Language Model Training

  7. LionMuon: Alternating Spectral and Sign Descent for Efficient Training

    Sep 28, 2026Arman Bolatov, Artem Riabinin, Nikita Kornilov +4Stochastic OptimizationLanguage Model Pretraining

  8. No Free Efficiency: Revisiting the Trade-off Between Training Efficiency and Model Vulnerability

    Sep 27, 2026Yiyong Liu, Jun Sakuma, Michael Backes +1Adversarial RobustnessEfficient Language Model Training

  9. The Life of a Token: from Words to Bits on the Wire

    Sep 17, 2026Davide Avesani, Pengwenlong Gu, Sotiris Skaperas +1Communication-Efficient Distributed TrainingHigh-Performance Computing

  10. Size Matters: Foundation Model for Czech HTML documents

    Sep 16, 2026Martin Dvořák, Vít Tlustoš, Artyom Voronin +4Language Model PretrainingEfficient Language Model Training

  11. Structural priors for data-efficient language learning

    Sep 12, 2026Yana Veitsman, Jonas Mayer Martins, Jonathan Lautenschlager +1Language Model PretrainingNeural Network Initialization

  12. Data-Efficient Language Modeling: From Frontier Advancement to Principle-Guided Model Improvement

    Sep 12, 2026Shuxing Yang, Kaihao Zhu, Junjie Yang +13Efficient Language Model TrainingLanguage Modeling

  13. Parallelism Strategy Chaining for Fast Training Convergence

    Sep 7, 2026Minchul Kang, Changyong Shin, Younghun Go +4Efficient Language Model TrainingLLM Training

  14. Toppling the Hierarchy in Byte-level Language Modeling

    Aug 31, 2026Lukas Edman, Alexander FraserEfficient Language Model TrainingByte-Level Language Model

  15. Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090

    Aug 27, 2026Kairong Luo, Jiarui Cui, Yaorui Yin +8Language Model PretrainingLanguage Model Scaling Laws

  16. Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model

    Aug 13, 2026Mohammed Sabry, Sean Augenstein, Keith Rush +1Language Model PretrainingEfficient Language Model Training

  17. LazyTrain: Limited-resource Allocation toward Zero-waste Yield Optimization in Large Language Model Training

    Aug 12, 2026Xiaojun Wu, Cehao Yang, Honghao Liu +5Efficient Language Model TrainingLLM Training

  18. TELLME: Test-Enhanced Learning for Language Model Enrichment

    Aug 12, 2026Minjun Kim, Inho Won, Hyeonseok Lim +6Domain-Adaptive PretrainingEfficient Language Model Training

  19. PARALLEL: A Prefrontal-Aligned Reinforcement inspired Approach for Language-Model Learning under Explicit Limits

    Jul 31, 2026Namkyung Yoon, Sanghong Kim, Hwangnam KimContinual Learning for LLMsLLM Fine-Tuning

  20. SDO: Structure-Aware Data Organization for Efficient LLM Post-Training

    Jul 29, 2026Jinliang Gao, Ning Yang, Hai Wang +2Training Data CurationEfficient Language Model Training

  21. PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoning

    Jul 20, 2026Hang Zhang, Warren J. GrossLLM Fine-TuningEfficient Language Model Training

  22. Long-Context Fine-Tuning with Limited VRAM

    Jul 16, 2026Vladimir Fedosov, Aleksandr Sazhin, Artemiy Grinenko +1Fine-TuningKV-Cache Offloading

  23. LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

    Jul 16, 2026Changhai Zhou, Kieran Liu, Yuhua Zhou +17Efficient Language Model TrainingLong-Context Modeling

  24. Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training

    Jul 6, 2026Jingwei Zuo, Cong Zeng, Ilyas Chahed +6Memorization in Language ModelsNeural Network Memorization

  25. Parameter Golf: What Really Works?

    Jul 1, 2026Prashanna Mani Paudel, Shivanand Venkanna SheshappanavarLLM EvaluationLLM Compression

  26. CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield

    Jun 30, 2026Dohyeon Kwon, Youngjin ParkMixture-of-Experts Language ModelsLLM Compression

  27. BluTrain: A C++/CUDA Framework for AI Systems

    Jun 23, 2026Adhitya Charan, Adwaid Suresh, Anuj Kumar +19GPU AccelerationHigh-Performance Computing

  28. FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training

    Jun 22, 2026Dikshant Kukreja, Kritarth Prasad, Avinash Anand +6Automatic DifferentiationBackpropagation

  29. Pythagoras-Prover: Advancing Efficient Formal Proving via Augmented Lean Formalisation

    Jun 10, 2026Joshua Ong Jun Leang, Zheng Zhao, Mihaela Cătălina Stoian +5Automated Theorem ProvingEfficient Language Model Training

  30. Unifying Data, Memory, and Compute Efficiency in LLM training: A Survey

    Jun 9, 2026Vanessa Schmidt, Huy Hoang Nguyen, Cédric Jung +2Efficient Language Model TrainingLLM Training

  31. q0: Primitives for Hyper-Epoch Pretraining

    Jun 2, 2026Bishwas Mandal, Shmuel Berman, Akshay Vegesna +1Language Model PretrainingEfficient Language Model Training

  32. PortBERT: Navigating the Depths of Portuguese Language Models

    Jun 1, 2026Raphael Scheible-Schmitt, Henry He, Armando B. MendesLanguage Model PretrainingEfficient Language Model Training

  33. When Data Is Scarce: Scaling Sparse Language Models with Repeated Training

    May 31, 2026Boqian Wu, Qiao Xiao, Patrik Okanovic +6Language Model Scaling LawsEfficient Language Model Training

  34. Memory-Efficient LLM Training with Dynamic Sparsity: From Stability to Practical Scaling

    May 30, 2026Qiao Xiao, Boqian Wu, Patrik Okanovic +6Language Model PretrainingEfficient Language Model Training

  35. PithTrain: A Compact and Agent-Native MoE Training System

    May 29, 2026Ruihang Lai, Hao Kang, Haozhan Tang +6Mixture-of-Experts Language ModelsEfficient Language Model Training

  36. Towards Efficient LLMs Annealing with Principled Sample Selection

    May 29, 2026Yuanjian Xu, Jianing Hao, Wanbo Zhang +2Language Model PretrainingEfficient Language Model Training

  37. D3^3: Dynamic Directional Graph-Constrained Data Scheduling for LLM Training

    May 29, 2026Yuanjian Xu, Jianing Hao, Guang Zhang +1Efficient Language Model TrainingLLM Training

  38. MIRA: Mid-training Rubric Anchoring for Source-Aware Data Selection

    May 28, 2026Haowen Wang, Yaxin Du, Jian Yang +9Data SelectionEfficient Language Model Training