LLM Training

LLM: Large Language Model

Momentum

31 papers in the last four weeks, up 72% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 226

All topics
CardsList
  1. GraphEcho: Structural Redundancy and Evidence Provenance in LLM Graph Agents

    Sep 15, 2026Sikun Wang, Yixi Zhou, Lei Fan +1LLM Reasoning with GraphsLLM Agent Evaluation

  2. Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data

    Sep 10, 2026Atindra Jha, Margaret Li, Jure Leskovec +2Mixture of ExpertsSparse Mixture-of-Experts

  3. Rebalancing Token Importance in Language Models with TF-IDF Weighted Cross-Entropy Loss

    Sep 10, 2026Zhijian Li, Stefan Larson, Kevin LeachMemorization in Language ModelsLLM Fine-Tuning

  4. Parallelism Strategy Chaining for Fast Training Convergence

    Sep 7, 2026Minchul Kang, Changyong Shin, Younghun Go +4Efficient Language Model TrainingLLM Training

  5. Language, Language Models, and What We're Talking About

    Sep 3, 2026Malvina NissimLanguage ModelingLLM Training

  6. BASP: Communication-Efficient Batch-Aware Sequence Parallelism for LLM Training

    Sep 2, 2026Bigyan Ghimire, Jon C. CalhounCommunication-Efficient Distributed TrainingLong-Context Language Modeling

  7. Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall

    Sep 1, 2026Jacqueline He, Howard Yen, Shuyue Stella Li +9Language Model DistillationFactual Knowledge in Language Models

  8. Efficiently Estimating Optimal Hyperparameter Scaling Laws through Power-Law Entropy Search

    Sep 1, 2026Zhiliang Chen, Sebastian Ament, David Eriksson +4Bayesian OptimizationLanguage Model Scaling Laws

  9. When Tokenization is Secretly Output Supervision

    Sep 1, 2026Tanja Baeumel, Josef van Genabith, Simon OstermannLLM Training

  10. Instella-MoE Technical Report

    Sep 1, 2026Jiang Liu, Sudhanshu Ranjan, Prakamya Mishra +10Mixture-of-Experts Language ModelsLanguage Model Post-Training

  11. Context Staircase: Signature-Aligned Dynamics of Token Embeddings under Small Initialization

    Aug 31, 2026Junjie Yao, Liangkai Hang, Zhi-Qin John XuLanguage Model PretrainingWord Embeddings

  12. CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents

    Aug 31, 2026Amir Saeidi, Zehua Zhang, Rishitosh Singh +6LLM AgentsLLM Agent Training

  13. DataFoundry: Evolving Data Preparators via Recursive Self-Improvement

    Aug 30, 2026Cehao Yang, Xiaojun Wu, Xueyuan Lin +4Training Data CurationDomain Adaptation for LLMs

  14. DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

    Aug 13, 2026Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina +2Language ModelingLLM Training

  15. Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model

    Aug 13, 2026Mohammed Sabry, Sean Augenstein, Keith Rush +1Language Model PretrainingEfficient Language Model Training

  16. Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge

    Aug 12, 2026Arda Uzunoglu, Benjamin Van Durme, Daniel KhashabiLong-Context Language ModelingFactual Knowledge in Language Models

  17. LazyTrain: Limited-resource Allocation toward Zero-waste Yield Optimization in Large Language Model Training

    Aug 12, 2026Xiaojun Wu, Cehao Yang, Honghao Liu +5Efficient Language Model TrainingLLM Training

  18. Decodable But Not Detachable: Training Data Granularity Determines Parametric Modularity in Large Language Models

    Aug 10, 2026Marcus Armstrong, Navid Ayoobi, Arjun MukherjeeLLM InterpretabilityCircuits in Language Models

  19. Fusion Training for Mathematical Generalization in Large Language Models

    Aug 10, 2026Congfeng Cao, Pengyu Zhang, Jelke BloemLLM Training

  20. Instability of LLM Pre-Pretraining: It Doesn't Always Help. An Investigation on Multiple Languages

    Aug 9, 2026Sofiia Riazhskykh, Nam Luu, Ondřej BojarLanguage Model PretrainingLinguistic Typology

  21. Scaling Inherently Interpretable Language Models

    Aug 6, 2026Guide Labs Team, Andreas Madsen, Aya Abdelsalam Ismail +7Language Model SteeringLLM Interpretability

  22. OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling

    Aug 5, 2026Indraneil Paul, Falko Helm, Goran Glavaš +1Software EngineeringLong-Context Language Modeling

  23. AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction

    Aug 1, 2026Ziqiang Cui, Han Shi, Bowei He +8Multi-Token PredictionLLM Inference Acceleration

  24. Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training

    Jul 30, 2026Jiawen Tao, Miao Peng, Yaoming Li +7Language Model PretrainingSynthetic Data Pretraining