LLM Training

LLM: Large Language Model

Momentum

31 papers in the last four weeks, up 72% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 226

All topics
CardsList
  1. Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models

    Jun 23, 2026Kwok Chun Au, Adam BlockDeep Learning OptimizationLLM Training

  2. Internal Data Repetition Destroys Language Models

    Jun 23, 2026Jessica Chudnovsky, Joshua Kazdan, Noam Levi +6Memorization in Language ModelsLanguage Model Scaling Laws

  3. FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training

    Jun 22, 2026Dikshant Kukreja, Kritarth Prasad, Avinash Anand +6Automatic DifferentiationBackpropagation

  4. Towards Understanding the Power and Limits of the Muon Optimizer: A River-Valley Perspective

    Jun 19, 2026Tianqi Shen, Jinji Yang, Runze Shi +3Deep Learning OptimizationMuon Optimizer

  5. RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories

    Jun 17, 2026Kaiyan Zhao, Zhongtao Miao, Akiko Aizawa +1Language Model PretrainingTraining Data Selection

  6. The Stanford EDGAR Filings Dataset: Reconstructing U.S. Corporate and Financial Disclosures into Layout-Faithful and Token-Efficient Pretraining Data

    Jun 16, 2026Nick Bettencourt, Xiaowei Ding, Kay GieseckeDocument UnderstandingLong-Context Language Modeling

  7. Small Initialization Matters for Large Language Models

    Jun 16, 2026Liangkai Hang, Junjie Yao, Zhiyu Li +3Language Model PretrainingNeural Network Initialization

  8. From Prompts to Responses: Dual-Sided Data Leakage and Defense in Split Large Language Models

    Jun 12, 2026Zixuan Gu, Xiaojun Ye, Yang LiuPrivacy-Preserving Language ModelsPrivacy Leakage in Language Models

  9. Small LLMs: Pruning vs. Training from Scratch

    Jun 12, 2026Yufeng Xu, Taiming Lu, Kunjun Li +3Language Model PretrainingLLM Pruning

  10. Natively Unlearnable Large Language Models

    Jun 11, 2026Gaurav R. Ghosal, Pratyush Maini, Aditi RaghunathanActivation SparsityMachine Unlearning

  11. Ouroboros-Spatial: Closing the Data-Model Loop for Spatial Reasoning

    Jun 10, 2026Enhan Zhao, Wei Wu, Yuanrui Zhang +23D Spatial ReasoningSynthetic Data Generation

  12. Improving Cross-Format Robustness in Language Models with Multi-Format Training

    Jun 10, 2026June M. Liu, Shaomian Zheng, He Cao +3Language Model RobustnessLLM Training

  13. Life Cycle Assessment of Pre-training the Lucie 7B Open-Source Large Language Model on the Jean Zay Supercomputer

    Jun 9, 2026Marc Léobet, Pierre-François Lavallée, Jean-Pierre LorréEnergy-Efficient MLLLM Training

  14. Unifying Data, Memory, and Compute Efficiency in LLM training: A Survey

    Jun 9, 2026Vanessa Schmidt, Huy Hoang Nguyen, Cédric Jung +2Efficient Language Model TrainingLLM Training

  15. IS-CoT: Breaking the Long-form Generation Collapse via Interleaved Structural Thinking

    Jun 8, 2026Zechen Sun, Yuyang Sun, Zecheng Tang +6Open-Ended GenerationLong-Form Document Generation

  16. FlashCP: Load-Balanced Communication-Efficient Context Parallelism for LLM Training

    Jun 7, 2026Zheng Wang, Eric Liu, Linan Jiang +5Communication-Efficient Distributed TrainingLong-Context Language Modeling

  17. Minibatch Selection for Language Models via Partition Matroid Constrained Gradient Matching

    Jun 6, 2026Prayas Agrawal, Prateek Chanda, Ishita Khatri +3Submodular OptimizationLLM Fine-Tuning

  18. DataEvolver: Automatic Data Preparation for Large Language Models through Multi-Level Self-Evolving

    Jun 5, 2026Chao Deng, Shaolei Zhang, Ju Fan +1Training Data CurationLLM Training

  19. Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search

    Jun 4, 2026Shing Yin Wong, Shaocheng Liu, Linqi Song +2Automated Theorem ProvingLLM Training

  20. Spectral Scaling Laws of Muon

    Jun 2, 2026Gagik Magakyan, Pablo Parrilo, Asuman OzdaglarNewton-Schulz IterationMomentum Methods

  21. Unlocking Feature Learning in Gated Delta Networks at Scale

    Jun 2, 2026Yifeng Liu, Quanquan GuNeural Network OptimizationHyperparameter Transfer

  22. MiCU: End-to-End Smart Home Command Understanding with Large Language Model

    May 31, 2026Haowei Han, Kexin Hu, Weiwei Cai +6Internet of ThingsLLM Training