LLM Training

LLM: Large Language Model

Momentum

31 papers in the last four weeks, up 72% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 226

All topics
CardsList
  1. Fault-tolerant foundation models

    Oct 7, 2026Trevor McCourt, Ila R. Fiete, Isaac L. ChuangLLM TrainingLanguage Model Scaling Laws

  2. Dynamic Minimax Regret Optimization for Robust LLM Post-Training

    Oct 5, 2026Chengbo Zang, Haoyu Dong, Mehmet Kerem Turkcan +3Dynamic Regret MinimizationDistributionally Robust Optimization

  3. ORCA: The Annealed Spectral Conditioning Optimizer for Faster, Better LLM Training

    Oct 5, 2026Yuanshi Liu, Boyuan Jiang, Liang Hou +4Spectral RegularizationDeep Learning Optimization

  4. CIPHER-MoE: Balancing Efficiency and Routing Fidelity in Trillion-Scale MoE Training

    Oct 5, 2026Jing Li, Jian Meng, Yingmeng Gao +8Expert Load BalancingExpert Routing

  5. AF-Muon: An AdamW-Free Muon Optimizer for Tied-Embedding Models

    Oct 1, 2026Arash Lagzian, Paniz Halvachi, Junming Zhang +2Memory-Efficient OptimizationMuon Optimizer

  6. Persistent Depth Ordering amid Shifting Block-Bypass Responses in Language Model Pretraining

    Oct 1, 2026Shengye Tao, Yinzhu Cheng, Haihua XieLLM InterpretabilityCausal Interventions in Language Models

  7. Leto: Fast In-Place Recovery for LLM Training on Surviving Hardware

    Sep 30, 2026Geon-Woo Kim, Joon Ha Kim, Daehyeok KimFault-Tolerant Distributed TrainingLLM Training

  8. Closing the Loop: Practical Training Recipes for Looped Language Models

    Sep 30, 2026Andrei Marchenko, Viacheslav Bezrukov, Oleg Kashurin +5Efficient Language Model TrainingLLM Training

  9. Forking: Sudden Overfitting Under Replay

    Sep 30, 2026Shanbin Yu, Shaoyang Guo, Haoran Zhao +2Neural Network GeneralizationLLM Training

  10. MASCRDM: Multi-Agent System for Compliance Risk Detection and Mitigation in Training Process of Large Language Models

    Sep 30, 2026Yan Zhang, Chuming Wei, Ruien Li +3LLM SafetyLanguage Model Bias Evaluation

  11. Multi-LLM Collaborative Alignment via Stackelberg Games

    Sep 30, 2026Christina Hahn, Shangbin Feng, Dean Light +3RL for Language ModelsLLM Alignment

  12. Trajectory Soup: Pushing the Compute-Scaling Frontier of LLM Mid-training via Diverse Trajectories

    Sep 29, 2026Zhehao Huang, Changxin Tian, Qingyuan Yang +5Language Model ScalingModel Merging

  13. ER-JEPA: Experience Replay Improves Joint-Embedding Predictive Learning in Language Models

    Sep 29, 2026Jingnan Pu, Zi-En Fan, Feng LianMemory-Augmented Language ModelsJoint-Embedding Predictive Architecture

  14. Normalize-Then-Precondition: A Hierarchical Approach to Marginal Scale and Interaction Geometry for LLM Training

    Sep 29, 2026Zixuan Gong, Zeyu Gan, Jiaye Teng +1Language Model PretrainingMatrix Optimization

  15. AutoLoCo: Communication Efficient Distributed LLM Training via Adaptive Synchronization

    Sep 29, 2026Pengyu He, Yan Zhang, Ruien Li +1Communication-Efficient Distributed TrainingDistributed Training

  16. Principled Thoughts for Latent Recursive LLM Systems

    Sep 28, 2026Fahd Seddik, Fatemeh FardContinuous Latent ReasoningMulti-Agent LLMs

  17. Telescopic Language Models

    Sep 28, 2026Zhilin Guo, Boqiao Zhang, Hakan Aktas +14Language ModelingEfficient Language Model Inference

  18. MeqMuon: Matrix-Equilibrating Muon for LLM Pretraining

    Sep 28, 2026Chang-Wei Shi, Xu Wang, Wu-Jun LiLanguage Model PretrainingEfficient Language Model Training

  19. Nereus: Adaptive Parallelism for LLM Post-Training

    Sep 28, 2026Songlin Jiang, Tuo Shi, Sitong Zhang +3LLM Inference SchedulingRL Post-Training

  20. Direct Self-Evolving Optimization: Evolving LLMs without Challenger Training

    Sep 28, 2026Yuyang Deng, Yu Wang, Jiayun WangSelf-Training for Language ModelsLarge Language Model-Guided Optimization

  21. Technical Manual for Toolkit for Confidence-Corpus Consistency, Corpus Absorption and Rule Learning via Fine-Tuning on a Fabricated Corpus

    Sep 23, 2026José Luciano Verçosa Marques, Frederico Jorge Heitmann, Daniel Omar Perez +3LLM Training

  22. Direct Optimization of Generators for Search in Automated Theorem Proving

    Sep 22, 2026Adam Ousherovitch, Ambuj TewariInference-Time SearchAutomated Theorem Proving

  23. The Life of a Token: from Words to Bits on the Wire

    Sep 17, 2026Davide Avesani, Pengwenlong Gu, Sotiris Skaperas +1Communication-Efficient Distributed TrainingHigh-Performance Computing

  24. Learn Your Own Thoughts: Abstract Token Curriculum

    Sep 17, 2026Khashayar Gatmiry, Avrajit Ghosh, Parsa Mirtaheri +4CoT ReasoningCurriculum Learning

  25. Preventing Model Collapse: A Fisher-Rao Perspective on the Dynamics of Training with Synthetic Data

    Sep 16, 2026Matteo Marchi, João Pedro Silvestre, Bahman Gharesifard +1Synthetic Data PretrainingModel Collapse

  26. MiST: Mid-Training LLMs for Cybersecurity

    Sep 16, 2026Oded Ovadia, Elad Ben Zaken, Elad Guttman +1Synthetic Data PretrainingDomain-Adaptive Pretraining