Language Model Scaling Laws

Momentum

15 papers in the last four weeks, up 200% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 94

All topics
CardsList
  1. A Systematic Analysis of the Predictive Power of LM Surprisal in Reading Chinese

    Oct 4, 2026Hongao Zhu, Muxiaoqiao Xu, Yikang Liu +4Language Model Scaling LawsLanguage Modeling

  2. Not All Error Yields to Scale: Where Scaling Stops in Vision-Language Inference

    Oct 1, 2026Xinye Zhao, Yunkai Dang, Yunchen Wu +1Vision-Language ModelsEfficient VLM Inference

  3. Scaling Laws for Looped Mixture of Experts

    Sep 30, 2026Yanbei Chen, Anirudh Goyal, Raghuraman KrishnamoorthiMixture-of-Experts Language ModelsLanguage Model Scaling Laws

  4. How Much Is an AI Token Worth? Scaling Laws for Wild AI-Generated Web Text

    Sep 30, 2026Jenna Russell, Ben Glickenhaus, Katherine Thai +4Language Model PretrainingSynthetic Data Pretraining

  5. From Spectra to Joint Schedules in LLM Pre-training: 3+3(+2) Scaling-Law Regimes

    Sep 30, 2026Yichen Wang, Fanghui Liu, Yudong ChenLanguage Model PretrainingDeep Learning Optimization

  6. ScAn-Bench: Evaluating Scaling Analysis Methodology

    Sep 28, 2026Artin Sermaxhaj, Nastaran Alipour, Donat Sinani +4VLM EvaluationLLM Evaluation

  7. X-MoD: Practical Scaling Laws for Sparse-Depth Routing Beyond Mixture-of-Depths

    Sep 28, 2026Bowen Dong, Yilong Fan, Tengyu Pan +6Language Model Scaling LawsMixture-of-Experts Models

  8. Does Step Law Transfer to Small-Scale Language Models? An Empirical Recalibration Below 59M Parameters

    Sep 23, 2026Egor Romanyukov, Timofey Novikov, Timur Shokarov +3Language Model Scaling LawsHyperparameter Transfer

  9. Scaling of Capability and Efficiency at Inference Time in Large Reasoning Models

    Sep 22, 2026Moritz Laber, Zohair Shafi, Germans Savcisens +6LLM Inference EfficiencyLanguage Model Scaling Laws

  10. Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models

    Sep 14, 2026Kalyani Marathe, Artidoro Pagnoni, Tomasz Limisiewicz +4Decoder-Only Language ModelsLanguage Model Scaling Laws

  11. Hyperparameter Scaling Laws Across MoE Sparsity

    Sep 8, 2026Changxin Tian, Kunlong Chen, Jia Liu +3Language Model Scaling LawsSparse Mixture-of-Experts

  12. Efficiently Estimating Optimal Hyperparameter Scaling Laws through Power-Law Entropy Search

    Sep 1, 2026Zhiliang Chen, Sebastian Ament, David Eriksson +4Bayesian OptimizationLanguage Model Scaling Laws

  13. Deriving Scaling Laws for OpenEuroLLM Models: Learning Rate, Batch Size and Loss

    Aug 28, 2026Niccolò Ajroldi, Diana Alexandra Onutu, Haider Al-Tahan +4Language Model PretrainingLearning Rate Scheduling

  14. Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090

    Aug 27, 2026Kairong Luo, Jiarui Cui, Yaorui Yin +8Language Model PretrainingLanguage Model Scaling Laws

  15. Small-Scale Experiments: Are We There Yet?

    Aug 12, 2026Nicholas Lourie, Kyunghyun Cho, Karen Ullrich +1Language Model Scaling LawsHyperparameter Optimization

  16. Skaling: Chinchilla's Exponents Meet Kaplan's Coupling

    Aug 7, 2026Mathurin Videau, Badr Youbi-Idrissi, David Lopez-Paz +1Language Model Scaling LawsNeural Scaling Laws

  17. Small Foundation Models of Human Cognition and Behaviour

    Aug 5, 2026Nick Oh, Fernand GobetComputational Cognitive ModelingLLM Fine-Tuning

  18. LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

    Aug 4, 2026Fengqi Zhu, Shaoxuan Xu, Jingyang Ou +11Mixture-of-Experts Language ModelsLanguage Model Scaling Laws

  19. Towards joint scaling laws with optimal batch size schedules

    Jul 30, 2026Jiaxiang Li, Zhiqi Bu, Shiyun XuDeep Learning OptimizationLanguage Model Scaling Laws

  20. Bridging Compute- and Data-Optimal Pretraining

    Jul 28, 2026Tian Qin, Kimia Hamidieh, David Alvarez-MelisLanguage Model PretrainingLanguage Model Scaling Laws

  21. Lomekwi: Resource-Bounded Tool Discovery in LLM Agents

    Jul 18, 2026Roshan Klein-Seetharaman, Daniel Wang, Andrew XuLanguage Model Scaling LawsLLM Agent Evaluation

  22. Domain-Aware Scaling Laws Uncover Data Synergy

    Jul 13, 2026Kimia Hamidieh, Lester Mackey, David Alvarez-MelisLanguage Model PretrainingLanguage Model Scaling Laws

  23. Will Scaling Improve Social Simulation with LLMs?

    Jul 2, 2026Caleb Ziems, William Held, Su Doga Karaca +3Opinion DynamicsLanguage Model Scaling Laws

  24. When Does Generating More Help? Disentangling Fixed-Source Synthesis from Source Expansion in Synthetic Data Scaling

    Jul 2, 2026Xu Guo, Jian Tong, Zhihui Lu +1Synthetic Data GenerationLanguage Model Scaling Laws

  25. How to Allocate Your Tokens? Scaling Laws with Training Steps and Batch Size

    Jul 1, 2026Fabian SchaippLanguage Model Scaling LawsScaling Laws

  26. Two AI Metrics Diverged: Will it Make All the Difference?

    Jul 1, 2026Alex Fogelson, Zachary A. Brown, Hans Gundlach +2Language Model Scaling LawsAI Governance

  27. Smooth Scaling Laws Hide Stepwise Token Learning

    Jun 29, 2026Pingjie Wang, Zechen Hu, Peiru Yang +2Language Model PretrainingLanguage Model Scaling Laws

  28. On the Nonlinearity of Learning Rate Scaling for LLM Training

    Jun 28, 2026Zaiwen Yang, Huaqing Zhang, Jing Xu +1Language Model Scaling LawsHyperparameter Transfer

  29. Scaling limit of the Random Language Model

    Jun 26, 2026Eric De GiuliLanguage Model Scaling LawsLanguage Modeling

  30. Neural Scaling Universality: If Exponents Are Fixed, Time to Understand Coefficients

    Jun 23, 2026Yizhou Liu, Jeff GoreLanguage Model Scaling LawsNeural Scaling Laws

  31. Can Scale Save Us From Plasticity Loss in Large Language Models?

    Jun 23, 2026J. Fernando Hernandez-Garcia, Tomás Figliolia, Beren MillidgeContinual Learning for LLMsLoss of Plasticity

  32. Scaling Laws for Task-Specific LLM Distillation

    Jun 23, 2026Lavinia Ghita, Dhruv Desai, Ioana BoierLLM PruningLLM Compression

  33. Internal Data Repetition Destroys Language Models

    Jun 23, 2026Jessica Chudnovsky, Joshua Kazdan, Noam Levi +6Memorization in Language ModelsLanguage Model Scaling Laws

  34. On the Smallness of the Large Language Models Scaling Exponents

    Jun 23, 2026Sauro Succi, Peter V. Coveney, Alex HansenEnergy-Efficient MLLanguage Model Scaling Laws

  35. The Energy Consumption of Transformer Fine-Tuning: A Roofline-Inspired Scaling Model

    Jun 22, 2026Mansour Zoubeirou a MayakiEnergy-Efficient MLTransformer

  36. Decomposing Factual Sycophancy in Language Models: How Size and Instruction Tuning Shape Robustness

    Jun 4, 2026Victor De Marez, Luna De Bruyne, Walter DaelemansLLM EvaluationLLM Sycophancy

  37. Entity tracking emerges in sub-billion parameter language models and exceeds human performance in naturalistic narratives

    Jun 4, 2026Karolina Drożdż, Micha HeilbronLLM EvaluationLanguage Model Scaling Laws

  38. Predictable Scaling Laws of Optimal Hyperparameters for LLM Continued Pre-training

    Jun 4, 2026Yongwei Zhou, Juncheng Diao, Junlin Shang +2Language Model Scaling LawsHyperparameter Transfer

  39. Structure and Scale in Simplicial Sequence Modelling

    May 31, 2026Matthew Farrugia-RobertsRepresentation GeometryTransformer

  40. When Data Is Scarce: Scaling Sparse Language Models with Repeated Training

    May 31, 2026Boqian Wu, Qiao Xiao, Patrik Okanovic +6Language Model Scaling LawsEfficient Language Model Training

  41. Item Response Scaling Laws: A Measurement Theory Approach for Efficient and Generalizable Neural Scaling Estimation

    May 29, 2026Sang Truong, Yuheng Tu, Rylan Schaeffer +1Language Model Scaling LawsTest-Time Scaling

  42. How LoRA Remembers? A Parametric Memory Law for LLM Finetuning

    May 28, 2026Ziwen Xu, Haiwen Hong, Linsong Yu +4Memorization in Language ModelsLLM Fine-Tuning

  43. Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention

    May 28, 2026Jing Huang, Daniel Wurgaft, Rachit Bansal +6Long-Tail LearningLanguage Model Scaling Laws

  44. The Curse of Helpfulness: Inverse Scaling Law in Robustness to Distractor Instructions via DistractionIF

    May 28, 2026Zeli Su, Zhankai Xu, Tianlei Chen +4Language Model Scaling LawsLanguage Model Robustness

  45. Law of Neural Interaction: Depth-Width Shape, Interaction Efficiency, and Generalization

    May 27, 2026Wenjie Sun, Jinning Yang, Shuai Zhang +1Neural Network GeneralizationLanguage Model Scaling Laws

  46. Unified Neural Scaling Laws

    May 25, 2026Ethan Caballero, Priyank Jaini, David Krueger +1Language Model Scaling LawsScaling Laws