Efficient Language Model Training

Latest papers 109

All topics
CardsList
  1. PARALLEL: A Prefrontal-Aligned Reinforcement inspired Approach for Language-Model Learning under Explicit Limits

    Jul 31, 2026Namkyung Yoon, Sanghong Kim, Hwangnam KimContinual Learning for LLMsLLM Fine-Tuning

  2. SDO: Structure-Aware Data Organization for Efficient LLM Post-Training

    Jul 29, 2026Jinliang Gao, Ning Yang, Hai Wang +2Training Data CurationEfficient Language Model Training

  3. PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoning

    Jul 20, 2026Hang Zhang, Warren J. GrossLLM Fine-TuningEfficient Language Model Training

  4. Long-Context Fine-Tuning with Limited VRAM

    Jul 16, 2026Vladimir Fedosov, Aleksandr Sazhin, Artemiy Grinenko +1Fine-TuningKV-Cache Offloading

  5. LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

    Jul 16, 2026Changhai Zhou, Kieran Liu, Yuhua Zhou +17Efficient Language Model TrainingLong-Context Modeling

  6. Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training

    Jul 6, 2026Jingwei Zuo, Cong Zeng, Ilyas Chahed +6Memorization in Language ModelsNeural Network Memorization

  7. Parameter Golf: What Really Works?

    Jul 1, 2026Prashanna Mani Paudel, Shivanand Venkanna SheshappanavarLLM EvaluationLLM Compression

  8. CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield

    Jun 30, 2026Dohyeon Kwon, Youngjin ParkMixture-of-Experts Language ModelsLLM Compression

  9. BluTrain: A C++/CUDA Framework for AI Systems

    Jun 23, 2026Adhitya Charan, Adwaid Suresh, Anuj Kumar +19GPU AccelerationHigh-Performance Computing

  10. FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training

    Jun 22, 2026Dikshant Kukreja, Kritarth Prasad, Avinash Anand +6Automatic DifferentiationBackpropagation

  11. Pythagoras-Prover: Advancing Efficient Formal Proving via Augmented Lean Formalisation

    Jun 10, 2026Joshua Ong Jun Leang, Zheng Zhao, Mihaela Cătălina Stoian +5Automated Theorem ProvingEfficient Language Model Training

  12. Unifying Data, Memory, and Compute Efficiency in LLM training: A Survey

    Jun 9, 2026Vanessa Schmidt, Huy Hoang Nguyen, Cédric Jung +2Efficient Language Model TrainingLLM Training

  13. q0: Primitives for Hyper-Epoch Pretraining

    Jun 2, 2026Bishwas Mandal, Shmuel Berman, Akshay Vegesna +1Language Model PretrainingEfficient Language Model Training

  14. PortBERT: Navigating the Depths of Portuguese Language Models

    Jun 1, 2026Raphael Scheible-Schmitt, Henry He, Armando B. MendesLanguage Model PretrainingEfficient Language Model Training

  15. When Data Is Scarce: Scaling Sparse Language Models with Repeated Training

    May 31, 2026Boqian Wu, Qiao Xiao, Patrik Okanovic +6Language Model Scaling LawsEfficient Language Model Training

  16. Memory-Efficient LLM Training with Dynamic Sparsity: From Stability to Practical Scaling

    May 30, 2026Qiao Xiao, Boqian Wu, Patrik Okanovic +6Language Model PretrainingEfficient Language Model Training

  17. PithTrain: A Compact and Agent-Native MoE Training System

    May 29, 2026Ruihang Lai, Hao Kang, Haozhan Tang +6Mixture-of-Experts Language ModelsEfficient Language Model Training

  18. Towards Efficient LLMs Annealing with Principled Sample Selection

    May 29, 2026Yuanjian Xu, Jianing Hao, Wanbo Zhang +2Language Model PretrainingEfficient Language Model Training

  19. D3^3: Dynamic Directional Graph-Constrained Data Scheduling for LLM Training

    May 29, 2026Yuanjian Xu, Jianing Hao, Guang Zhang +1Efficient Language Model TrainingLLM Training

  20. MIRA: Mid-training Rubric Anchoring for Source-Aware Data Selection

    May 28, 2026Haowen Wang, Yaxin Du, Jian Yang +9Data SelectionEfficient Language Model Training