LLM Training

LLM: Large Language Model

Momentum

31 papers in the last four weeks, up 72% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 226

All topics
CardsList
  1. Harnessing the Potential of Optimizing Data Mixtures via Bayesian Domain Reweighting

    Jul 30, 2026Xiang Yuan, Kaiqing Lei, Zhenyu Jin +3Data Mixture OptimizationLLM Training

  2. Towards joint scaling laws with optimal batch size schedules

    Jul 30, 2026Jiaxiang Li, Zhiqi Bu, Shiyun XuDeep Learning OptimizationLanguage Model Scaling Laws

  3. Training Continuous Chain of Thought Models: A Tale of Two Regimes

    Jul 18, 2026Varun Yerram, He He, Eunsol ChoiCoT ReasoningContinuous Latent Reasoning

  4. The Information Shadow: Measuring Structural Limits on What Language Models Can Learn

    Jul 17, 2026Priyansh Srivastava, Romit ChatterjeeLLM AuditingLLM Training

  5. The Cost and Network Limits of Space-Based AI Compute

    Jul 15, 2026Kees van BerkelLLM InferenceCost-Aware Inference

  6. Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

    Jul 14, 2026Yubo Wang, Jiarong Liang, Yuxuan Zhang +5Masked Language ModelingCoding Agents

  7. Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training

    Jul 6, 2026Jingwei Zuo, Cong Zeng, Ilyas Chahed +6Memorization in Language ModelsNeural Network Memorization

  8. Improving LLMs via Validator-to-Generator Alignment

    Jul 2, 2026Juan Diego Rodriguez, Jocelyn Zhang, Katrin Erk +1LLM AlignmentLLM Reliability

  9. PHOENIX: Resilient LLM Training with Hot-Swapping via Zero-Overhead Checkpoint

    Jul 2, 2026Haotian Xie, Junlin Chen, Mingkai Zheng +2Fault-Tolerant Distributed TrainingDistributed Training

  10. CausalMix: Data Mixture as Causal Inference for Language Model Training

    Jul 1, 2026Zinan Tang, Yukun Zhang, Shaomian Zheng +6Data Mixture OptimizationLLM Training

  11. Prototype Language Models

    Jul 1, 2026Dan Ley, Giang Nguyen, Himabindu Lakkaraju +1LLM InterpretabilityLanguage Modeling

  12. One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining

    Jun 29, 2026Philip Zmushko, Egor Petrov, Nursultan Abdullaev +2Muon OptimizerPipeline Parallelism

  13. HSAP: A Hierarchical Sequence-aware Parallelism for Hybrid-Context Generative Models

    Jun 29, 2026Songxin Zhang, Zejian Xie, Zhuoyang Song +4Communication-Efficient Distributed TrainingLLM Training

  14. Smooth Scaling Laws Hide Stepwise Token Learning

    Jun 29, 2026Pingjie Wang, Zechen Hu, Peiru Yang +2Language Model PretrainingLanguage Model Scaling Laws

  15. How much of an LLM-generated clinical corpus is actually new? A production-scale measurement of content redundancy for provenance classification

    Jun 28, 2026Ali H. Lazem, William J. TeahanData ProvenanceClinical NLP

  16. On the Nonlinearity of Learning Rate Scaling for LLM Training

    Jun 28, 2026Zaiwen Yang, Huaqing Zhang, Jing Xu +1Language Model Scaling LawsHyperparameter Transfer

  17. Developmental Trajectories of Situation Modeling and Mentalizing in Transformer Language Models

    Jun 26, 2026Pamela D. Rivière, Cameron Jones, Sean TrottLLM EvaluationTheory of Mind

  18. Mechanism-Driven Monitors for Preemptive Detection of LLM Training Instability

    Jun 26, 2026Ruixuan Huang, Yipei Wang, Wenyi Fang +7Fault DetectionLLM Training

  19. Enhancing Numerical Prediction in LLMs via Smooth MMD Alignment

    Jun 26, 2026Zhuo Zuo, Li Yue, Wenhao Zheng +2Numerical Reasoning in Language ModelsMaximum Mean Discrepancy