Efficient Language Model Training

Latest papers 109

All topics
CardsList
  1. Inference-Native Zeroth-Order Optimization for LLMs

    May 27, 2026Zelin Li, Caiwen DingLLM ServingZeroth-Order Optimization

  2. Hierarchical Prompt-Domain Control and Learning for Resource-Constrained Agentic Language Models

    May 26, 2026Joan Vendrell Gallart, Russell Bent, Michael GrosskopfContinual Learning for LLM AgentsLanguage Model-Based Control

  3. BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training

    May 25, 2026Zili Zhang, Chengxu Yang, Shenglong Zhang +8Deep Learning OptimizationMultimodal Large Language Models

  4. Convex Optimization for Alignment and Preference Learning on a Single GPU

    May 22, 2026Miria Feng, Mert PilanciPairwise Preference LearningLLM Alignment

  5. One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs

    May 21, 2026Di He, Songjun Tu, Keyu Wang +2Learning Rate SchedulingEfficient Language Model Training

  6. torchtune: PyTorch native post-training library

    May 20, 2026Mark Obozov, Maxime Griot, Joseph Cummings +8LLM Fine-TuningEfficient Language Model Training

  7. OlmoEarth v1.2: A more efficient family of OlmoEarth models

    May 20, 2026Gabriel Tseng, Yawen Zhang, Favyen Bastani +8Efficient Neural Network InferenceGeospatial Foundation Models

  8. HRM-Text: Efficient Pretraining Beyond Scaling

    May 20, 2026Guan Wang, Changling Liu, Chenyu Wang +6Language Model PretrainingRecurrent Neural Networks

  9. Introspective X Training: Feedback Conditioning Improves Scaling Across all LLM Training Stages

    May 19, 2026Brandon Cui, Ximing Lu, Jaehun Jung +7Language Model PretrainingEfficient Language Model Training

  10. Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training

    May 18, 2026Yanru Wu, Jianning Wang, Chongxin Gan +1Audio QAEfficient Language Model Training

  11. DynMuon: A Dynamic Spectral Shaping View of Muon

    May 16, 2026Fangzhou Wu, Rikhav Shah, Sandeep Silwal +1Neural Network OptimizationMuon Optimizer

  12. DualKV: Shared-Prompt Flash Attention for Efficient RL Training with Large Rollouts and Long Contexts

    May 14, 2026Jiading Gai, Shuai Zhang, Xiang Song +2GPU AccelerationSelf-Attention

  13. Always Learning, Always Mixing: Efficient and Simple Data Mixing All The Time

    May 13, 2026Michael Y. Hu, Apurva Gandhi, Kyunghyun Cho +2Language Model PretrainingContinual Learning for LLMs

  14. DynaTrain: Fast Online Parallelism Switching for Elastic LLM Training

    May 12, 2026Yuanqing Wang, Yuchen Zhang, Hao Lin +9Efficient Language Model TrainingDistributed Training

  15. Predicting Large Model Test Losses with a Noisy Quadratic System

    May 9, 2026Chuning Li, Chris J. MaddisonLanguage Model Scaling LawsEfficient Language Model Training

  16. Rethinking Local Learning: A Cheaper and Faster Recipe for LLM Post-Training

    May 6, 2026Hengyu Shi, Tianyang Han, Peizhe Wang +3Efficient Language Model TrainingLLM Post-Training

  17. Budget-aware Auto Optimizer Configurator

    May 6, 2026Kang Liu, Wei Peng, Jianchen HuDeep Learning OptimizationMemory-Efficient Optimization

  18. ELAS: Efficient Pre-Training of Low-Rank Large Language Models via 2:4 Activation Sparsity

    May 5, 2026Jiaxi Li, Lu Yin, Li Shen +5Language Model PretrainingActivation Sparsity

  19. Compute Optimal Tokenization

    May 2, 2026Tomasz Limisiewicz, Artidoro Pagnoni, Srini Iyer +6Language Model Scaling LawsEfficient Language Model Training

  20. AutoSP: Unlocking Long-Context LLM Training Via Compiler-Based Sequence Parallelism

    Apr 29, 2026Ahan Gupta, Zhihao Wang, Neel Dani +3Efficient Language Model TrainingLLM Training

  21. Efficient Training on Multiple Consumer GPUs with RoundPipe

    Apr 29, 2026Yibin Luo, Shiwei Gao, Huichuan Zheng +2GPU AccelerationLLM Fine-Tuning