LLM Training

LLM: Large Language Model

Momentum

31 papers in the last four weeks, up 72% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 226

All topics
CardsList
  1. TierCheck: Tiered Checkpointing for Fault Tolerance in Large Language Model Training

    May 18, 2026Shujie Han, Feng Jiang, Patrick P. C. Lee +5Fault-Tolerant Distributed TrainingDistributed Training

  2. Charon: A Unified and Fine-Grained Simulator for Large-Scale LLM Training and Inference

    May 16, 2026Mengtian Yang, Zhekun Zhang, Mingheng Wu +3LLM InferenceLLM Inference Acceleration

  3. Fully Open Meditron: An Auditable Pipeline for Clinical LLMs

    May 15, 2026Xavier Theimer-Lienhard, Mushtaha El-Amin, Fay Elhassan +5HealthcareLLM Auditing

  4. Runtime-Orchestrated Second-Order Optimization for Scalable LLM Training

    May 15, 2026Yishun Lu, Junhao Zhang, Zeyu Yang +1Second-Order OptimizationLLM Training

  5. A Few GPUs, A Whole Lotta Scale: Faithful LLM Training Emulation with PrismLLM

    May 15, 2026Shaoke Xi, ChonLam Lao, Boyi Jia +11High-Performance ComputingDistributed Training

  6. A Theory of Training Profit-Optimal LLMs

    May 14, 2026Sophie Hao, William MerrillLLM Training

  7. FrontierSmith: Synthesizing Open-Ended Coding Problems at Scale

    May 14, 2026Runyuan He, Qiuyang Mang, Shang Zhou +14Synthetic Benchmark GenerationSynthetic Data Generation for Language Models

  8. Always Learning, Always Mixing: Efficient and Simple Data Mixing All The Time

    May 13, 2026Michael Y. Hu, Apurva Gandhi, Kyunghyun Cho +2Language Model PretrainingContinual Learning for LLMs

  9. Training Large Language Models to Predict Clinical Events

    May 12, 2026Benjamin Turtel, Paul Wilczewski, Kris SkotheimHealthcareLanguage Model Calibration

  10. Uncovering Symmetry Transfer in Large Language Models via Layer-Peeled Optimization

    May 12, 2026Zhehang Du, Hangfeng He, Weijie SuRepresentation GeometryLLM Training

  11. Scaling Laws for Mixture Pretraining Under Data Constraints

    May 12, 2026Anastasiia Sedova, Skyler Seto, Natalie Schluter +1Language Model PretrainingLanguage Model Scaling Laws

  12. Overtrained, Not Misaligned

    May 12, 2026Joel Schreiber, Ariel GoldsteinEarly StoppingLLM Fine-Tuning

  13. DynaTrain: Fast Online Parallelism Switching for Elastic LLM Training

    May 12, 2026Yuanqing Wang, Yuchen Zhang, Hao Lin +9Efficient Language Model TrainingDistributed Training

  14. Position: Let's Develop Data Probes to Fundamentally Understand How Data Affects LLM Performance

    May 11, 2026Shiqiang Wang, Herbert Woisetschläger, Hans Arno Jacobsen +1Synthetic Data GenerationLLM Training

  15. Speech-based Psychological Crisis Assessment using LLMs

    May 11, 2026Terumi Chiba, Yang Luo, Ziyun Cui +2Mental HealthSpeech Language Models

  16. BatchWeave: A Consistent Object-Store-Native Data Plane for Large Foundation Model Training

    May 11, 2026Ting Sun, Junjie Zhang, Xiao Yan +7Fault-Tolerant Distributed TrainingDistributed Training

  17. Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers

    May 9, 2026Aditya RanganathDeep Learning OptimizationMemory-Efficient Optimization

  18. Predicting Large Model Test Losses with a Noisy Quadratic System

    May 9, 2026Chuning Li, Chris J. MaddisonLanguage Model Scaling LawsEfficient Language Model Training

  19. XPERT: Expert Knowledge Transfer for Effective Training of Language Models

    May 9, 2026Chang Liu, Boyu Shi, Xu Yang +1Mixture-of-Experts Language ModelsKnowledge Augmentation for Language Models

  20. Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models

    May 8, 2026Aswin RRV, Jacob Dineen, Divij Handa +4Synthetic Data GenerationRL for Language Model Reasoning

  21. Features have life history. And we should care

    May 7, 2026Philipp Stecher, Sandro Radovanović, Vlasta Sikimić +1Representation LearningLLM Interpretability

  22. Normalized Architectures are Natively 4-Bit

    May 7, 2026Maxim Fishman, Brian Chmiel, Ron Banner +2LLM QuantizationNeural Representation Geometry

  23. Spectral Lens: Activation and Gradient Spectra as Diagnostics of LLM Optimization

    May 7, 2026Andy Zeyi Liu, Elliot Paquette, John SousRepresentation LearningDecoder-Only Language Models

  24. FinRAG-12B: A Production-Validated Recipe for Grounded Question Answering in Banking

    May 6, 2026Denys Katerenchuk, Pablo Duboue, Keelan Evanini +6Financial ServicesLLM Grounding

  25. Perturbation is All You Need for Extrapolating Language Models

    May 5, 2026Zetai Cen, Jin Zhu, Xinwei Shen +1OOD GeneralizationAutoregressive Language Modeling