Memory-Efficient Training

Latest papers 34

All topics
CardsList
  1. Q-PACE: Dynamic Precision Allocation for Quantization-Aware Training

    Oct 6, 2026Alexandra Volkova, Matin Ansaripour, Erik Schultheis +2LLM QuantizationQuantization-Aware Training

  2. Cut Binary Cross Entropy: Efficient Large-Vocabulary Loss and Gradient Kernels for Sequential Recommendation

    Oct 4, 2026Yaoyiran Li, Haowen Ning, Mohamed HammadSequential RecommendationRecommender Systems

  3. Clean: Second-order LLM Training at Linear Memory Cost via Nyström Sketching

    Oct 3, 2026Beheshteh T. Rakhshan, Sahar Rajabi, Maziar Sargordi Shikai Fang +2Second-Order OptimizationMemory-Efficient Training

  4. Scale-Split Neural Operator for Memory- and Data-Efficient 3D Turbulence Prediction

    Sep 30, 2026Shaoxiang Qin, Yucheng Zhao, Zongyi Li +2PDE Surrogate ModelingNeural Operators

  5. Look Before You Select: Rethinking Vocabulary Sparsification in On-Policy Distillation

    Sep 28, 2026Yongliang Miao, Shuang Liu, Yanguang Liu +2Language Model DistillationOn-Policy Distillation

  6. HiLoRe: What to Store, Compress, or Recompute for Efficient GRPO Training

    Sep 27, 2026Xinrui Chen, Mengyang Li, Ou Wu +1Group Relative Policy OptimizationPolicy Learning

  7. Low-Rank Friction for Memory-Efficient Transformer Pretraining

    Sep 24, 2026Rajit Rajpal, Benedict LeimkuhlerDeep Learning OptimizationLow-Rank Compression

  8. MENO: Memory-Efficient Neural Operator

    Sep 23, 2026Shengyang Xu, Weijun Zhang, Jun Hu +1PDE Surrogate ModelingPDE Operator Learning

  9. CacheDyG: Decoupling Temporal Propagation for Efficient Dynamic Graph Learning

    Sep 22, 2026PinHeng Zong, Ye YuanTemporal GNNsTemporal Link Prediction

  10. Layer-wise Curriculum Learning for Efficient LLM Compression

    Sep 16, 2026Donggeon Lee, Dooyeon Na, Seungmin Oh +1LLM CompressionCurriculum Learning

  11. LeanGRPO: Eliminating Redundant Recomputation in Diffusion RL

    Sep 3, 2026Sijie Wang, Zhiqiang Tan, Xinrui Yang +1RL for Diffusion ModelsRL Post-Training

  12. LazyTrain: Limited-resource Allocation toward Zero-waste Yield Optimization in Large Language Model Training

    Aug 12, 2026Xiaojun Wu, Cehao Yang, Honghao Liu +5Efficient Language Model TrainingLLM Training

  13. Batch Size or Negatives? A Selection Rule for Memory-Constrained Recommender Training

    Aug 11, 2026Artyom Sabitov, Daniil Volkov, Alexey ZaytsevMemory-Efficient OptimizationRecommender Systems

  14. ZeroLock: Concurrent Memory-Efficient LLM Training via Modular Update Decoupling

    Aug 8, 2026Wentao Dai, Xuanran Li, Yuxiang Zhang +2On-Device TrainingMemory-Efficient Fine-Tuning

  15. Backpropagation-Free Trunk Training via the Split Forward Gradients

    Jul 18, 2026Tian Qin, Wei-Min HuangBackpropagationGradient Descent

  16. FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training

    Jun 22, 2026Dikshant Kukreja, Kritarth Prasad, Avinash Anand +6Automatic DifferentiationBackpropagation

  17. Gefen: Optimized Stochastic Optimizer

    Jun 11, 2026Nadav Benedek, Tomer Koren, Ohad FriedDeep Learning OptimizationMemory-Efficient Optimization

  18. Unifying Data, Memory, and Compute Efficiency in LLM training: A Survey

    Jun 9, 2026Vanessa Schmidt, Huy Hoang Nguyen, Cédric Jung +2Efficient Language Model TrainingLLM Training

  19. GRZO: Group-Relative Zeroth-Order Optimization for Large Language Model Fine-Tuning

    Jun 1, 2026Liyan Tan, Yequan Zhao, Yifan Yang +3Fine-TuningMemory-Efficient Fine-Tuning

  20. Memory-Efficient LLM Training with Dynamic Sparsity: From Stability to Practical Scaling

    May 30, 2026Qiao Xiao, Boqian Wu, Patrik Okanovic +6Language Model PretrainingEfficient Language Model Training

  21. BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training

    May 25, 2026Zili Zhang, Chengxu Yang, Shenglong Zhang +8Deep Learning OptimizationMultimodal Large Language Models

  22. ChunkFT: Byte-Streamed Optimization for Memory-Efficient Full Fine-Tuning

    May 20, 2026Yongkang Liu, Zijing Wang, Mengjie Zhao +7Fine-TuningMemory-Efficient Fine-Tuning

  23. Beyond Square Roots: Explicit Memory-Efficient Factorization for Multi-Epoch Private Learning

    May 18, 2026Nikita P. Kalinin, Aki Rehn, Joel Daniel Andersson +2Differentially Private Stochastic Gradient DescentDifferential Privacy

  24. PowerStep: Memory-Efficient Adaptive Optimization via ℓp\ell_p-Norm Steepest Descent

    May 11, 2026Yao Lu, Dengdong Fan, Shixun Zhang +1Gradient DescentMemory-Efficient Optimization

  25. Budget-aware Auto Optimizer Configurator

    May 6, 2026Kang Liu, Wei Peng, Jianchen HuDeep Learning OptimizationMemory-Efficient Optimization

  26. Activation Compression in LLMs: Theoretical Analysis and Efficient Algorithm

    May 2, 2026Wen-Da Wei, Han-Bin Fang, Yang-Di Liu +3LLM CompressionGradient Compression

  27. AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs

    May 1, 2026Wenxiang Lin, Juntao Huang, Luhan Zhang +5LLM QuantizationCommunication-Efficient Distributed Training

  28. Gaussians on a Diet: High-Quality Memory-Bounded 3D Gaussian Splatting Training

    Apr 21, 2026Yangming Zhang, Jian Xu, Chaojian Li +73D Gaussian Splatting3D Gaussian Pruning

  29. GroupDPO: Memory-Efficient Group-Wise Direct Preference Optimization

    Apr 17, 2026Jixuan Leng, Si Si, Hsiang-Fu Yu +2LLM AlignmentDirect Preference Optimization

  30. HO-SFL: Hybrid-Order Split Federated Learning with Backprop-Free Clients and Dimension-Free Aggregation

    Mar 16, 2026Qiyuan Chen, Xian Wu, Yi Wang +1Communication-Efficient Distributed TrainingZeroth-Order Optimization