Continued Pretraining

Latest papers 33

All topics
CardsList
  1. Sequential Pretraining Favors Large Models

    Oct 7, 2026Mohnish Harwani, Yujia ZhengLanguage Model PretrainingContinued Pretraining

  2. Task Vector Descent: Learning from Non-IID Batches

    Oct 4, 2026Anton Baumann, Jonas Hübotter, Zeynep Akata +1Continual Learning for LLMsTask Arithmetic

  3. Replay on Demand: An Emergent Curriculum for Balancing Adaptation and Forgetting in Continued Pretraining

    Sep 30, 2026Lukas Thede, Shengzhuang Chen, Stefan Winzeck +3Continual Learning for LLMsReplay-Based Continual Learning

  4. What Pretraining and Midtraining Make Learnable from Rewards?

    Sep 29, 2026Chiwun Yang, Xiaoyu LiRL for Language Model ReasoningContinued Pretraining

  5. Time-Incremental Continued Pretraining of LLMs: Knowledge Updates Without Catastrophic Forgetting

    Sep 20, 2026Fırat Öncel, Salman Hussain Ali, Mirco Ravanelli +2Continual Learning for LLMsFactual Knowledge in Language Models

  6. Climate-ModernBERT: Revisiting Corpus Composition for Domain-Adaptive Continued Pretraining

    Sep 7, 2026Yongan Yu, Shantam Raj, Jingwei Ni +3Multi-Source Domain AdaptationDomain-Adaptive Pretraining

  7. DKL: Decoupled Knowledge Learning for Instruction-Tuned Language Models

    Sep 2, 2026Kushagra Bhushan, Meghanadh Pulivarthi, Sai Krishna Reddy Sathi +7Knowledge Augmentation for Language ModelsRetrieval-Augmented Generation

  8. KItCAT: Knowledge Injection via Input Corruption for Auto-regressive Training

    Aug 31, 2026Meghanadh Pulivarthi, Kushagra Bhushan, Vineet Kumar +5Language Model PretrainingKnowledge Augmentation for Language Models

  9. Seeing the Unseen: Visual Similarity for Pixel Language Model Adaptation

    Aug 31, 2026Ran Zhang, Miryam de Lhoneux, Wessel PoelmanContinued PretrainingLow-Resource Language Processing

  10. Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training

    Aug 26, 2026Qiankai Xu, Qiguang Chen, Zixin Su +4Long-Form Document GenerationSynthetic Benchmark Generation

  11. AgriField-40K: Adapting Vision Models to Agriculture With Efficient Continual Pretraining

    Aug 8, 2026Vasileios Tzouras, Paraskevas Pegios, Lazaros NalpantidisAgricultural Image AnalysisMasked Autoencoders

  12. Different Perturbations, Different Mechanisms: Understanding Continued Pre-training for Zero-Shot Dialect Robustness

    Aug 6, 2026Aarohi Srivastava, David ChiangLanguage Model PretrainingMultilingual Language Models

  13. OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling

    Aug 5, 2026Indraneil Paul, Falko Helm, Goran Glavaš +1Software EngineeringLong-Context Language Modeling

  14. Two-Stage Bengali Sentiment Classification: Domain Adaptation Through Continual Learning and Parameter-Efficient Fine-Tuning

    Aug 2, 2026MD Shaikh Rahman, Syed Maudud E Rabbi, Muhammad Mahbubur RashidSentiment AnalysisDomain-Adaptive Pretraining

  15. From Sinhala to Dhivehi: Cross-Lingual Transfer Learning for Low-Resource Speech Recognition

    Jul 7, 2026Lukmal Ilyas, Nevidu JayatillekeContinued PretrainingLow-Resource Speech Recognition

  16. Predictable Scaling Laws of Optimal Hyperparameters for LLM Continued Pre-training

    Jun 4, 2026Yongwei Zhou, Juncheng Diao, Junlin Shang +2Language Model Scaling LawsHyperparameter Transfer

  17. Beyond Captions: Context-Grounded Reconstruction for Biomedical Multimodal Continued Pretraining

    May 31, 2026Guanghao Zhu, Zeyu Liu, Zhitian Hou +10Vision-Language ModelsMultimodal Pretraining

  18. Universal CT Representations from Anatomy to Disease Phenotype through Agglomerative Pretraining

    May 21, 2026Yuheng Li, Yuan Gao, Haoyu Dong +5Medical Imaging Foundation ModelsMedical VLMs

  19. A Causal Language Modeling Detour Improves Encoder Continued Pretraining

    May 12, 2026Rian Touchent, Eric de la ClergerieLanguage Model PretrainingMasked Language Modeling

  20. Freeze Deep, Train Shallow: Interpretable Layer Allocation for Continued Pre-Training

    May 12, 2026Yu-Hang Wu, Qin-Yuan Liu, Qiu-Yang Zhao +3Fine-TuningContinued Pretraining

  21. Towards Understanding Continual Factual Knowledge Acquisition of Language Models: From Theory to Algorithm

    May 11, 2026Haoyu Wang, Yifan Shang, Zhongxiang Sun +3Continual Learning for LLMsGenerative Replay

  22. Where Does Long-Context Supervision Actually Go? Effective-Context Exposure Balancing

    May 11, 2026Jinchang Zhu, Jindong Li, Chengyu Zou +4Long-Context Language ModelingAdaptive Loss Weighting

  23. SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training

    May 9, 2026Shengkun Tang, Zekun Wang, Bo Zheng +7Mixture-of-Experts PruningLLM Pruning

  24. Prototype Guided Post-pretraining for Single-Cell Representation Learning

    May 8, 2026Sachini Weerasekara, Natasha Darras, Sagar Kamarthi +2Representation LearningContinued Pretraining

  25. Teaching LLMs Program Semantics via Symbolic Execution Traces

    May 7, 2026Jonas Bayer, Stefan Zetzsche, Olivier Bouissou +3LLM EvaluationContinued Pretraining