LLM Training

LLM: Large Language Model

Momentum

31 papers in the last four weeks, up 72% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 226

All topics
CardsList
  1. Fault-tolerant foundation models

    Oct 7, 2026Trevor McCourt, Ila R. Fiete, Isaac L. ChuangLLM TrainingLanguage Model Scaling Laws

  2. Dynamic Minimax Regret Optimization for Robust LLM Post-Training

    Oct 5, 2026Chengbo Zang, Haoyu Dong, Mehmet Kerem Turkcan +3Dynamic Regret MinimizationDistributionally Robust Optimization

  3. ORCA: The Annealed Spectral Conditioning Optimizer for Faster, Better LLM Training

    Oct 5, 2026Yuanshi Liu, Boyuan Jiang, Liang Hou +4Spectral RegularizationDeep Learning Optimization

  4. CIPHER-MoE: Balancing Efficiency and Routing Fidelity in Trillion-Scale MoE Training

    Oct 5, 2026Jing Li, Jian Meng, Yingmeng Gao +8Expert Load BalancingExpert Routing

  5. AF-Muon: An AdamW-Free Muon Optimizer for Tied-Embedding Models

    Oct 1, 2026Arash Lagzian, Paniz Halvachi, Junming Zhang +2Memory-Efficient OptimizationMuon Optimizer

  6. Persistent Depth Ordering amid Shifting Block-Bypass Responses in Language Model Pretraining

    Oct 1, 2026Shengye Tao, Yinzhu Cheng, Haihua XieLLM InterpretabilityCausal Interventions in Language Models

  7. Leto: Fast In-Place Recovery for LLM Training on Surviving Hardware

    Sep 30, 2026Geon-Woo Kim, Joon Ha Kim, Daehyeok KimFault-Tolerant Distributed TrainingLLM Training

  8. Closing the Loop: Practical Training Recipes for Looped Language Models

    Sep 30, 2026Andrei Marchenko, Viacheslav Bezrukov, Oleg Kashurin +5Efficient Language Model TrainingLLM Training

  9. Forking: Sudden Overfitting Under Replay

    Sep 30, 2026Shanbin Yu, Shaoyang Guo, Haoran Zhao +2Neural Network GeneralizationLLM Training

  10. MASCRDM: Multi-Agent System for Compliance Risk Detection and Mitigation in Training Process of Large Language Models

    Sep 30, 2026Yan Zhang, Chuming Wei, Ruien Li +3LLM SafetyLanguage Model Bias Evaluation

  11. Multi-LLM Collaborative Alignment via Stackelberg Games

    Sep 30, 2026Christina Hahn, Shangbin Feng, Dean Light +3RL for Language ModelsLLM Alignment

  12. Trajectory Soup: Pushing the Compute-Scaling Frontier of LLM Mid-training via Diverse Trajectories

    Sep 29, 2026Zhehao Huang, Changxin Tian, Qingyuan Yang +5Language Model ScalingModel Merging

  13. ER-JEPA: Experience Replay Improves Joint-Embedding Predictive Learning in Language Models

    Sep 29, 2026Jingnan Pu, Zi-En Fan, Feng LianMemory-Augmented Language ModelsJoint-Embedding Predictive Architecture

  14. Normalize-Then-Precondition: A Hierarchical Approach to Marginal Scale and Interaction Geometry for LLM Training

    Sep 29, 2026Zixuan Gong, Zeyu Gan, Jiaye Teng +1Language Model PretrainingMatrix Optimization

  15. AutoLoCo: Communication Efficient Distributed LLM Training via Adaptive Synchronization

    Sep 29, 2026Pengyu He, Yan Zhang, Ruien Li +1Communication-Efficient Distributed TrainingDistributed Training

  16. Principled Thoughts for Latent Recursive LLM Systems

    Sep 28, 2026Fahd Seddik, Fatemeh FardContinuous Latent ReasoningMulti-Agent LLMs

  17. Telescopic Language Models

    Sep 28, 2026Zhilin Guo, Boqiao Zhang, Hakan Aktas +14Language ModelingEfficient Language Model Inference

  18. MeqMuon: Matrix-Equilibrating Muon for LLM Pretraining

    Sep 28, 2026Chang-Wei Shi, Xu Wang, Wu-Jun LiLanguage Model PretrainingEfficient Language Model Training

  19. Nereus: Adaptive Parallelism for LLM Post-Training

    Sep 28, 2026Songlin Jiang, Tuo Shi, Sitong Zhang +3LLM Inference SchedulingRL Post-Training

  20. Direct Self-Evolving Optimization: Evolving LLMs without Challenger Training

    Sep 28, 2026Yuyang Deng, Yu Wang, Jiayun WangSelf-Training for Language ModelsLarge Language Model-Guided Optimization

  21. Technical Manual for Toolkit for Confidence-Corpus Consistency, Corpus Absorption and Rule Learning via Fine-Tuning on a Fabricated Corpus

    Sep 23, 2026José Luciano Verçosa Marques, Frederico Jorge Heitmann, Daniel Omar Perez +3LLM Training

  22. Direct Optimization of Generators for Search in Automated Theorem Proving

    Sep 22, 2026Adam Ousherovitch, Ambuj TewariInference-Time SearchAutomated Theorem Proving

  23. The Life of a Token: from Words to Bits on the Wire

    Sep 17, 2026Davide Avesani, Pengwenlong Gu, Sotiris Skaperas +1Communication-Efficient Distributed TrainingHigh-Performance Computing

  24. Learn Your Own Thoughts: Abstract Token Curriculum

    Sep 17, 2026Khashayar Gatmiry, Avrajit Ghosh, Parsa Mirtaheri +4CoT ReasoningCurriculum Learning

  25. Preventing Model Collapse: A Fisher-Rao Perspective on the Dynamics of Training with Synthetic Data

    Sep 16, 2026Matteo Marchi, João Pedro Silvestre, Bahman Gharesifard +1Synthetic Data PretrainingModel Collapse

  26. MiST: Mid-Training LLMs for Cybersecurity

    Sep 16, 2026Oded Ovadia, Elad Ben Zaken, Elad Guttman +1Synthetic Data PretrainingDomain-Adaptive Pretraining

  27. GraphEcho: Structural Redundancy and Evidence Provenance in LLM Graph Agents

    Sep 15, 2026Sikun Wang, Yixi Zhou, Lei Fan +1LLM Reasoning with GraphsLLM Agent Evaluation

  28. Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data

    Sep 10, 2026Atindra Jha, Margaret Li, Jure Leskovec +2Mixture of ExpertsSparse Mixture-of-Experts

  29. Rebalancing Token Importance in Language Models with TF-IDF Weighted Cross-Entropy Loss

    Sep 10, 2026Zhijian Li, Stefan Larson, Kevin LeachMemorization in Language ModelsLLM Fine-Tuning

  30. Parallelism Strategy Chaining for Fast Training Convergence

    Sep 7, 2026Minchul Kang, Changyong Shin, Younghun Go +4Efficient Language Model TrainingLLM Training

  31. Language, Language Models, and What We're Talking About

    Sep 3, 2026Malvina NissimLanguage ModelingLLM Training

  32. BASP: Communication-Efficient Batch-Aware Sequence Parallelism for LLM Training

    Sep 2, 2026Bigyan Ghimire, Jon C. CalhounCommunication-Efficient Distributed TrainingLong-Context Language Modeling

  33. Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall

    Sep 1, 2026Jacqueline He, Howard Yen, Shuyue Stella Li +9Language Model DistillationFactual Knowledge in Language Models

  34. Efficiently Estimating Optimal Hyperparameter Scaling Laws through Power-Law Entropy Search

    Sep 1, 2026Zhiliang Chen, Sebastian Ament, David Eriksson +4Bayesian OptimizationLanguage Model Scaling Laws

  35. When Tokenization is Secretly Output Supervision

    Sep 1, 2026Tanja Baeumel, Josef van Genabith, Simon OstermannLLM Training

  36. Instella-MoE Technical Report

    Sep 1, 2026Jiang Liu, Sudhanshu Ranjan, Prakamya Mishra +10Mixture-of-Experts Language ModelsLanguage Model Post-Training

  37. Context Staircase: Signature-Aligned Dynamics of Token Embeddings under Small Initialization

    Aug 31, 2026Junjie Yao, Liangkai Hang, Zhi-Qin John XuLanguage Model PretrainingWord Embeddings

  38. CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents

    Aug 31, 2026Amir Saeidi, Zehua Zhang, Rishitosh Singh +6LLM AgentsLLM Agent Training

  39. DataFoundry: Evolving Data Preparators via Recursive Self-Improvement

    Aug 30, 2026Cehao Yang, Xiaojun Wu, Xueyuan Lin +4Training Data CurationDomain Adaptation for LLMs

  40. DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

    Aug 13, 2026Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina +2Language ModelingLLM Training

  41. Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model

    Aug 13, 2026Mohammed Sabry, Sean Augenstein, Keith Rush +1Language Model PretrainingEfficient Language Model Training

  42. Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge

    Aug 12, 2026Arda Uzunoglu, Benjamin Van Durme, Daniel KhashabiLong-Context Language ModelingFactual Knowledge in Language Models

  43. LazyTrain: Limited-resource Allocation toward Zero-waste Yield Optimization in Large Language Model Training

    Aug 12, 2026Xiaojun Wu, Cehao Yang, Honghao Liu +5Efficient Language Model TrainingLLM Training

  44. Decodable But Not Detachable: Training Data Granularity Determines Parametric Modularity in Large Language Models

    Aug 10, 2026Marcus Armstrong, Navid Ayoobi, Arjun MukherjeeLLM InterpretabilityCircuits in Language Models

  45. Fusion Training for Mathematical Generalization in Large Language Models

    Aug 10, 2026Congfeng Cao, Pengyu Zhang, Jelke BloemLLM Training

  46. Instability of LLM Pre-Pretraining: It Doesn't Always Help. An Investigation on Multiple Languages

    Aug 9, 2026Sofiia Riazhskykh, Nam Luu, Ondřej BojarLanguage Model PretrainingLinguistic Typology

  47. Scaling Inherently Interpretable Language Models

    Aug 6, 2026Guide Labs Team, Andreas Madsen, Aya Abdelsalam Ismail +7Language Model SteeringLLM Interpretability

  48. OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling

    Aug 5, 2026Indraneil Paul, Falko Helm, Goran Glavaš +1Software EngineeringLong-Context Language Modeling

  49. AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction

    Aug 1, 2026Ziqiang Cui, Han Shi, Bowei He +8Multi-Token PredictionLLM Inference Acceleration

  50. Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training

    Jul 30, 2026Jiawen Tao, Miao Peng, Yaoming Li +7Language Model PretrainingSynthetic Data Pretraining