Data Repetition in Language Model Training

Latest papers 25

All topics
CardsList
  1. No Model Required: Text Entropy Rate Filtering Mitigates Iterative Fine-Tuning Collapse

    Oct 1, 2026Lewis MitchellLLM Fine-TuningModel Collapse

  2. Forking: Sudden Overfitting Under Replay

    Sep 30, 2026Shanbin Yu, Shaoyang Guo, Haoran Zhao +2Neural Network GeneralizationLLM Training

  3. Don't Forget! Decomposing the Training Dynamics of Memorization in Language Models

    Sep 28, 2026Florian Eichin, Philipp Mondorf, Andrei Mircea +3Memorization in Language ModelsData Repetition in Language Model Training

  4. Data-Efficient Language Modeling: From Frontier Advancement to Principle-Guided Model Improvement

    Sep 12, 2026Shuxing Yang, Kaihao Zhu, Junjie Yang +13Efficient Language Model TrainingLanguage Modeling

  5. Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data

    Sep 10, 2026Atindra Jha, Margaret Li, Jure Leskovec +2Mixture of ExpertsSparse Mixture-of-Experts

  6. Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views

    Sep 3, 2026Joseph Lee, Yidi Huang, Dokyoon Kim +2Language Model PretrainingData Augmentation

  7. Rewriting or Reweighting? A Geometric Account in Language Models

    Aug 3, 2026Juntong Wang, Shengkun Yang, Xiyuan Wang +1Language Model Post-TrainingRepresentation Geometry in Language Models

  8. Temperature-driven inversion and nonlinear dynamics in ChatGPT-like AIs

    Aug 2, 2026Neil F. Johnson, Frank Yingjie Huo, Bella Xinrui LiLanguage Model DecodingAutoregressive Generation

  9. Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning

    Jul 21, 2026Lizhe Fang, Weizhou Shen, Tianyi Tang +1LLM GroundingReward Shaping

  10. ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation

    Jul 14, 2026Qingyu Zhang, Qianhao Yuan, Hongyu Lin +7Open-Ended GenerationLLM Pruning

  11. Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training

    Jul 6, 2026Jingwei Zuo, Cong Zeng, Ilyas Chahed +6Memorization in Language ModelsNeural Network Memorization

  12. How much of an LLM-generated clinical corpus is actually new? A production-scale measurement of content redundancy for provenance classification

    Jun 28, 2026Ali H. Lazem, William J. TeahanData ProvenanceClinical NLP

  13. Internal Data Repetition Destroys Language Models

    Jun 23, 2026Jessica Chudnovsky, Joshua Kazdan, Noam Levi +6Memorization in Language ModelsLanguage Model Scaling Laws

  14. Can Editing 1 Neuron Fix Repetition Loops in LLMs?

    Jun 9, 2026Aristotelis Lazaridis, Aman Sharma, Dylan Bates +3LLM Self-CorrectionMechanistic Interpretability

  15. When Data Is Scarce: Scaling Sparse Language Models with Repeated Training

    May 31, 2026Boqian Wu, Qiao Xiao, Patrik Okanovic +6Language Model Scaling LawsEfficient Language Model Training

  16. Scaling Laws for Mixture Pretraining Under Data Constraints

    May 12, 2026Anastasiia Sedova, Skyler Seto, Natalie Schluter +1Language Model PretrainingLanguage Model Scaling Laws