Language Model Scaling Laws

Momentum

15 papers in the last four weeks, up 200% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 95

All topics
CardsList
  1. Fault-tolerant foundation models

    Oct 7, 2026Trevor McCourt, Ila R. Fiete, Isaac L. ChuangLLM TrainingLanguage Model Scaling Laws

  2. A Systematic Analysis of the Predictive Power of LM Surprisal in Reading Chinese

    Oct 4, 2026Hongao Zhu, Muxiaoqiao Xu, Yikang Liu +4Language Model Scaling LawsLanguage Modeling

  3. Not All Error Yields to Scale: Where Scaling Stops in Vision-Language Inference

    Oct 1, 2026Xinye Zhao, Yunkai Dang, Yunchen Wu +1Vision-Language ModelsEfficient VLM Inference

  4. Scaling Laws for Looped Mixture of Experts

    Sep 30, 2026Yanbei Chen, Anirudh Goyal, Raghuraman KrishnamoorthiMixture-of-Experts Language ModelsLanguage Model Scaling Laws

  5. How Much Is an AI Token Worth? Scaling Laws for Wild AI-Generated Web Text

    Sep 30, 2026Jenna Russell, Ben Glickenhaus, Katherine Thai +4Language Model PretrainingSynthetic Data Pretraining

  6. From Spectra to Joint Schedules in LLM Pre-training: 3+3(+2) Scaling-Law Regimes

    Sep 30, 2026Yichen Wang, Fanghui Liu, Yudong ChenLanguage Model PretrainingDeep Learning Optimization

  7. ScAn-Bench: Evaluating Scaling Analysis Methodology

    Sep 28, 2026Artin Sermaxhaj, Nastaran Alipour, Donat Sinani +4VLM EvaluationLLM Evaluation

  8. X-MoD: Practical Scaling Laws for Sparse-Depth Routing Beyond Mixture-of-Depths

    Sep 28, 2026Bowen Dong, Yilong Fan, Tengyu Pan +6Language Model Scaling LawsMixture-of-Experts Models

  9. Does Step Law Transfer to Small-Scale Language Models? An Empirical Recalibration Below 59M Parameters

    Sep 23, 2026Egor Romanyukov, Timofey Novikov, Timur Shokarov +3Language Model Scaling LawsHyperparameter Transfer

  10. Scaling of Capability and Efficiency at Inference Time in Large Reasoning Models

    Sep 22, 2026Moritz Laber, Zohair Shafi, Germans Savcisens +6LLM Inference EfficiencyLanguage Model Scaling Laws

  11. Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models

    Sep 14, 2026Kalyani Marathe, Artidoro Pagnoni, Tomasz Limisiewicz +4Decoder-Only Language ModelsLanguage Model Scaling Laws

  12. Hyperparameter Scaling Laws Across MoE Sparsity

    Sep 8, 2026Changxin Tian, Kunlong Chen, Jia Liu +3Language Model Scaling LawsSparse Mixture-of-Experts

  13. Efficiently Estimating Optimal Hyperparameter Scaling Laws through Power-Law Entropy Search

    Sep 1, 2026Zhiliang Chen, Sebastian Ament, David Eriksson +4Bayesian OptimizationLanguage Model Scaling Laws

  14. Deriving Scaling Laws for OpenEuroLLM Models: Learning Rate, Batch Size and Loss

    Aug 28, 2026Niccolò Ajroldi, Diana Alexandra Onutu, Haider Al-Tahan +4Language Model PretrainingLearning Rate Scheduling

  15. Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090

    Aug 27, 2026Kairong Luo, Jiarui Cui, Yaorui Yin +8Language Model PretrainingLanguage Model Scaling Laws

  16. Small-Scale Experiments: Are We There Yet?

    Aug 12, 2026Nicholas Lourie, Kyunghyun Cho, Karen Ullrich +1Language Model Scaling LawsHyperparameter Optimization

  17. Skaling: Chinchilla's Exponents Meet Kaplan's Coupling

    Aug 7, 2026Mathurin Videau, Badr Youbi-Idrissi, David Lopez-Paz +1Language Model Scaling LawsNeural Scaling Laws

  18. Small Foundation Models of Human Cognition and Behaviour

    Aug 5, 2026Nick Oh, Fernand GobetComputational Cognitive ModelingLLM Fine-Tuning

  19. LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

    Aug 4, 2026Fengqi Zhu, Shaoxuan Xu, Jingyang Ou +11Mixture-of-Experts Language ModelsLanguage Model Scaling Laws

  20. Towards joint scaling laws with optimal batch size schedules

    Jul 30, 2026Jiaxiang Li, Zhiqi Bu, Shiyun XuDeep Learning OptimizationLanguage Model Scaling Laws

  21. Bridging Compute- and Data-Optimal Pretraining

    Jul 28, 2026Tian Qin, Kimia Hamidieh, David Alvarez-MelisLanguage Model PretrainingLanguage Model Scaling Laws

  22. Lomekwi: Resource-Bounded Tool Discovery in LLM Agents

    Jul 18, 2026Roshan Klein-Seetharaman, Daniel Wang, Andrew XuLanguage Model Scaling LawsLLM Agent Evaluation

  23. Domain-Aware Scaling Laws Uncover Data Synergy

    Jul 13, 2026Kimia Hamidieh, Lester Mackey, David Alvarez-MelisLanguage Model PretrainingLanguage Model Scaling Laws