Large Language Model Pretraining

Latest papers 127

All topics
CardsList
  1. How Much Is an AI Token Worth? Scaling Laws for Wild AI-Generated Web Text

    Sep 30, 2026Jenna Russell, Ben Glickenhaus, Katherine Thai +4Large Language Model PretrainingArtificial Intelligence Models

  2. From Spectra to Joint Schedules in LLM Pre-training: 3+3(+2) Scaling-Law Regimes

    Sep 30, 2026Yichen Wang, Fanghui Liu, Yudong ChenBatchStochastic Gradient Descent

  3. Synthetic Pre-pretraining Survives Scale, but Not as a Grammatical Prior

    Sep 30, 2026Atsuki Yamaguchi, Tatsuro Inaba, Joel Niklaus +3Large Language Model PretrainingGrammaticality

  4. How Does Local Landscape Geometry Evolve in Language Model Pre-Training?

    Sep 30, 2026Zhanpeng Zhou, Yuhan Sun, Bingrui Li +4Large Language Model PretrainingBatch

  5. Lasting Effects of Abstract Pretraining Beyond Perplexity

    Sep 30, 2026Zachary Shinnick, Hemanth Saratchandran, Damien Teney +1Large Language Model PretrainingPretraining

  6. Zero-shot Dependency Parsing with Unsupervised Cross-Lingual Bootstrapping

    Sep 29, 2026Lalita Lowphansirikul, Attapol Rutherford, Jian Gang Ngui +2Cross-Lingual TransferSyntactic Structure

  7. Normalize-Then-Precondition: A Hierarchical Approach to Marginal Scale and Interaction Geometry for LLM Training

    Sep 29, 2026Zixuan Gong, Zeyu Gan, Jiaye Teng +1Spectral PreconditioningLarge Language Model Pretraining

  8. MeqMuon: Matrix-Equilibrating Muon for LLM Pretraining

    Sep 28, 2026Chang-Wei Shi, Xu Wang, Wu-Jun LiLarge Language Model PretrainingMuon

  9. SOLO: Pretraining Billion-Parameter Language Models with Shared-Output Local Learning

    Sep 28, 2026Bojian Yin, Shurong Wang, Yuqi Pan +1Large Language Model PretrainingSingular Learning Theory

  10. SOLAR: A State-Driven Online Learning Rate Scheduler for LLM Pretraining

    Sep 28, 2026Qiulin Shang, Binyu Wang, Yongqi Qiao +3BatchLarge Language Model Pretraining

  11. ReScraper: Unified Scraping and Cleaning of Web Data for Effective LLM Pretraining

    Sep 28, 2026Zichun Yu, Jiarui Yan, Shlok Sanghvi +2Agentic CrawlersData-Curation

  12. One Latent, Many Tokens: Jointly Learning Compressed Embeddings for Efficient Language Diffusion

    Sep 27, 2026Yulin Yuan, Ying Zhang, Xiangming MengDiffusion Language ModelsLarge Language Model Pretraining

  13. Approximating Softmax in Pretrained LLMs: Model Sensitivity and Kernel Acceleration

    Sep 27, 2026Shangzhen Zhu, Muyan Hu, Tomasz KozlowskiGumbel-Softmax RelaxationTransformer Architectures

  14. Terminal Shrinkage Averaging Reveals a Schedule-Estimator Interaction in LLM Pretraining

    Sep 21, 2026Adam Ousherovitch, Yixin WangBatchLarge Language Model Pretraining

  15. Why Pretraining Fails to Share Cross-Lingual Knowledge

    Sep 16, 2026Adam Gaber, Uriel Dolev, Elisabeth Fittschen +3Cross-Lingual TransferMultilingual Language Models

  16. Parameter-Efficient Adaptation of Pretrained Language Models for Time-Series Forecasting

    Sep 14, 2026Tamanna Kumavat, Georg Brunner, Kyriakos FlourisForecasting BackboneTime Series Forecasting

  17. Structural priors for data-efficient language learning

    Sep 12, 2026Yana Veitsman, Jonas Mayer Martins, Jonathan Lautenschlager +1Large Language Model PretrainingLoss Function

  18. Osprey: Target-agnostic Pre-training Makes Stronger Drafters in Speculative Decoding

    Sep 8, 2026Fengxiang Bie, Yuqing Jian, Yifan Yu +7Speculative DecodingDrafts

  19. Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views

    Sep 3, 2026Joseph Lee, Yidi Huang, Dokyoon Kim +2Large Language Model PretrainingReasoning Gaps

  20. Probing Factual Knowledge Transfer with Training Data Interventions

    Sep 1, 2026Romina Oji, Marc Braun, Marcel Bollmann +2Multilingual Language ModelsLarge Language Model Pretraining

  21. Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090

    Aug 27, 2026Kairong Luo, Jiarui Cui, Yaorui Yin +8Large Language Model PretrainingQwen3

  22. Measuring Task-Agnostic Training Data Influence Across Language Model Pretraining

    Aug 13, 2026Yuto Nishida, Hirokazu Kiyomaru, Yusuke Oda +6Large Language Model PretrainingTraining Data

  23. Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model

    Aug 13, 2026Mohammed Sabry, Sean Augenstein, Keith Rush +1Large Language Model PretrainingPretraining

  24. Reducing Pretraining-Generation Mismatch in Diffusion Language Models

    Aug 10, 2026Xiaocheng Lu, Huabin Liu, Song Guo +1Diffusion Language ModelsLarge Language Model Pretraining

  25. Instability of LLM Pre-Pretraining: It Doesn't Always Help. An Investigation on Multiple Languages

    Aug 9, 2026Sofiia Riazhskykh, Nam Luu, Ondřej BojarLarge Language Model PretrainingPretraining

  26. Different Perturbations, Different Mechanisms: Understanding Continued Pre-training for Zero-Shot Dialect Robustness

    Aug 6, 2026Aarohi Srivastava, David ChiangDialectsMultilingual Language Models

  27. Logic Before Language: Pre-pretraining on Formal Derivations Fosters Skill Acquisition and Compressibility

    Aug 4, 2026Jo-Ku Cheng, Nikolaos Aletras, Marco ValentinoLarge Language Model PretrainingPretraining

  28. CDAE: Enhancing Perturbation Robustness in Pretrained Language Models with Contrastive Denoising

    Jul 30, 2026Sina Heydari, Amirreza Abbasi, Mohsen Hooshmand +1Large Language Model Pretraining

  29. PreDiff-LM: Pretrained Discrete Masked Diffusion Language Modeling with Hybrid Attention

    Jul 28, 2026Zhengtao Yao, Runhao Li, Xupeng Chen +12Diffusion Language ModelsLarge Language Model Pretraining

  30. Adaptive Depth Sparse Framework: Similarity-Driven Resource Allocation for Pre-Trained LLMs

    Jul 23, 2026Yidu Wu, Xiang Wang, Kejie Zhao +3LLM Inference OptimizationDynamic Sparse Attention

  31. Understanding Reasoning from Pretraining to Post-Training

    Jul 17, 2026Jingyan Shen, Ang Li, Salman Rahman +4LLM Reasoning StrategiesLarge Language Model Pretraining

  32. Same Loss, Same Noise, Opposite Schedules: Noise Structure and Optimizer Normalization Jointly Determine Whether Learning-Rate Cooldown Helps

    Jul 14, 2026Subham Singh, Ashutosh Mishra, Subha RautBatchBatch Normalization

  33. Domain-Aware Scaling Laws Uncover Data Synergy

    Jul 13, 2026Kimia Hamidieh, Lester Mackey, David Alvarez-MelisSynergyLarge Language Model Pretraining

  34. TheBioCollection: Unified Pre-Training Scale LLM Corpus for Biology

    Jul 9, 2026Hyunjin Seo, Hyeon Hwang, Gyubok Lee +7Life Sciences ResearchText Corpora

  35. GeoFP8: Geometry-Aware FP8 Gradient Compression for Distributed LLM Training

    Jul 8, 2026Jieying Wang, Zizhong Wang, Fangru Linghu +3Large Language Model QuantizationLarge Language Model Pretraining

  36. Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention

    Jul 5, 2026Siyu Ding, Mingchuan Ma, Jiabo Tong +3Fp8Large Language Model Pretraining

  37. MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages

    Jul 1, 2026Maximilian Idahl, Jörg Tiedemann, Sampo Pyysalo +19Multilingual Language ModelsLarge Language Model Pretraining

  38. GLIP: Graph and LLM Joint Pretraining for Graph-Level Tasks

    Jun 29, 2026Haoxin Sun, Yiqing Lin, Yajun Huang +3Graph Neural NetworksGraph-Llm Integrations

  39. DLR: Zero-Inference-Cost Latent Residuals for Low-Rank Pre-Training

    Jun 27, 2026Dong Wang, Wenwu Tang, Yun Cheng +1Large Language Model PretrainingLow-Rank Structure

  40. Interleaved Speech Language Models Latently Work In Text

    Jun 21, 2026Talia Sternberg, Gallil Maimon, Yossi AdiSpeech Language ModelsLarge Language Model Pretraining

  41. TALAS: Teacher-Anchored Layer Alignment with Adaptive Sharpness-Aware Minimization for Embedding Distillation

    Jun 20, 2026Quoc Phong Dao, Hoang Son Nguyen, Pham Khanh Chi +4Knowledge DistillationDistributional Alignment

  42. Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe

    Jun 18, 2026Qian Zhao, Kunlong Chen, Changxin Tian +9Fp8Shrink

  43. IHUBERT: Vector-Based Semantic Deduplication and Domain-Balanced Pretraining for Persian Resources

    Jun 18, 2026Arash Ghafouri, Mahdi Firouzmandi, Hossein Saberi +1PersianLarge Language Model Pretraining

  44. Clusters are All You Need: Pre-Training the Tsetlin Machine with Semantic Clusters from Language Models for Interpretability

    Jun 18, 2026Jiechao Gao, Rohan Kumar Yadav, Yuangang Li +4Bert-Based ModelsInterpretability

  45. RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories

    Jun 17, 2026Kaiyan Zhao, Zhongtao Miao, Akiko Aizawa +1Large Language Model PretrainingGeneralized Linear Model

  46. Fantastic Pretraining Optimizers and Where to Find Them II: Hyperball Optimization

    Jun 15, 2026Kaiyue Wen, Xingyu Dang, Kaifeng Lyu +2Adaptive OptimizersWeight Decay

  47. Demystifying Training-Time Augmentation for Data-Constrained Language Model Pretraining

    Jun 15, 2026Michael K. Chen, Xikun Zhang, Fan Bai +2Large Language Model PretrainingData Augmentation

  48. Unifying Local Communications and Local Updates for LLM Pretraining

    Jun 9, 2026Pietro Cagnasso, Eugene Belilovsky, Edouard OyallonLarge Language Model PretrainingGossip

  49. Breaking the Bubble: Asynchronous Pipeline Parallel Training with Bounded Weight Inconsistency

    Jun 5, 2026Itay Elam, Eliron Rahimi, Avi Mendelson +1Asynchronous ExecutionCpu-Gpu Hybrid Designs