Efficient Language Model Training

Latest papers 109

All topics
CardsList
  1. Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts

    Apr 21, 2026Chaitanya Dwivedi, Binxuan Huang, Himanshu Gupta +3Efficient Language Model TrainingLanguage Model Scaling

  2. FreezeEmpath: Efficient Training for Empathetic Spoken Chatbots with Frozen LLMs

    Apr 20, 2026Yun Hong, Yan Zhou, Yang FengSpoken Dialogue SystemsEfficient Language Model Training

  3. HO-SFL: Hybrid-Order Split Federated Learning with Backprop-Free Clients and Dimension-Free Aggregation

    Mar 16, 2026Qiyuan Chen, Xian Wu, Yi Wang +1Communication-Efficient Distributed TrainingZeroth-Order Optimization

  4. Stabilizing Native Low-Rank LLM Pretraining

    Feb 12, 2026Paul Janson, Edouard Oyallon, Eugene BelilovskyLanguage Model PretrainingLow-Rank Matrix Decomposition

  5. Revisiting the Shape Convention of Transformer Language Models

    Feb 6, 2026Feng-Ting Liao, Guan-Ting Yi, Tzu-Quan Lin +2Efficient Transformer InferenceTransformer FFNs

  6. Distilling the Essence: Efficient Reasoning Distillation via Sequence Truncation

    Dec 24, 2025Wei-Rui Chen, Vignesh Kothapalli, Ata Fatahibaarzi +5CoT DistillationSelective Knowledge Distillation

  7. EDGC: Entropy-driven Dynamic Gradient Compression for Efficient LLM Training

    Nov 13, 2025Qingao Yi, Jiaang Duan, Jun Zhang +5Communication-Efficient Distributed TrainingGradient Compression

  8. A Survey on Efficient Vision-Language-Action Models

    Oct 27, 2025Zhaoshu Yu, Bo Wang, Pengpeng Zeng +7Model CompressionRobotic Data Collection

  9. Scale or Reason? A Compute-Equivalent Analysis of Reasoning Distillation

    Sep 26, 2025Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Kevin El Haddad +2CoT DistillationLLM Fine-Tuning

  10. Concertina: Data-Centric Adaptive Pipeline Parallelism for Efficient Heterogeneous Long-Context LLM Training

    Sep 25, 2025Shiju Wang, Yujie Wang, Fangcheng Fu +6Long-Context Language ModelingEfficient Language Model Training

  11. Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts

    Aug 13, 2025Maxime Heuillet, Yufei Cui, Boxing Chen +2RL for Language Model ReasoningEfficient Language Model Training

  12. PLoRA: Efficient Concurrent LoRA Training for Large Language Models

    Aug 4, 2025Minghao Yan, Zhuang Wang, Zhen Jia +2LLM Fine-TuningEfficient Language Model Training

  13. ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining

    May 26, 2025Melis Ilayda Bal, Volkan Cevher, Michael MuehlebachLanguage Model PretrainingEfficient Language Model Training

  14. A Survey of Transformer-based Language Models with Focus on Efficiency

    May 15, 2024Wazib Ansar, Saptarsi Goswami, Amlan ChakrabartiLLM CompressionEnergy-Efficient ML

  15. DA-Cramming: Enhancing Cost-Effective Language Model Pretraining with Dependency Agreement Integration

    Nov 8, 2023Martin Kuo, Jianyi Zhang, Dongting Li +1Language Model PretrainingEfficient Language Model Training

  16. Almost Free State Prediction Separation

    Date pendingJohn Langford, Nathan Godey, Giovanni Monea +5Language Model PretrainingEfficient Language Model Training