Deep Learning Optimization

Latest papers 132

All topics
CardsList
  1. The Stability of Singular Distribution: A Spectral Perspective on the Two-Phase Dynamics of Language Model Pre-training

    May 26, 2026Hongtao Zhang, Wenjie Zhou, Chenxi Jia +2Language Model PretrainingDeep Learning Optimization

  2. Reparametrizing Shampoo and SOAP for Subspace Basis Updates and BFloat16 Storage

    May 25, 2026Alan Milligan, Zikun Xu, Simon Lacoste-Julien +2Deep Learning OptimizationMemory-Efficient Optimization

  3. BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training

    May 25, 2026Zili Zhang, Chengxu Yang, Shenglong Zhang +8Deep Learning OptimizationMultimodal Large Language Models

  4. EMA-Nesterov: Stabilizing Nesterov's Lookahead for Accelerated Deep Learning Optimization

    May 25, 2026Chung-Yiu Yau, Dawei Li, Athanasios Glentis +3Deep Learning OptimizationGradient Descent

  5. PILOT: Policy-Informed Learned Optimization for Adaptive Deep Network Training

    May 23, 2026Sattam Altuuaim, Lama Ayash, Muhammad Mubashar +1Deep Learning OptimizationLearning to Optimize

  6. Momentum Streams for Optimizer-Inspired Transformers

    May 23, 2026Jingchu Gai, Nai-Chieh Huang, Jiayun WuDeep Learning OptimizationTransformer

  7. Recursive Block-Diagonal Coupling for Resource-Efficient Training of Vision Models

    May 22, 2026Maxim Henry, Adrien Deliège, Sébastien Piérard +1Deep Learning OptimizationEfficient ViTs

  8. Anytime Training with Schedule-Free Spectral Optimization

    May 21, 2026Anuj Apte, Pranav Deshpande, Niraj Kumar +2Deep Learning OptimizationLearning Rate Scheduling

  9. AMUSE: Anytime Muon with Stable Gradient Evaluation

    May 21, 2026Jueun Kim, Baekrok Shin, Jihun Yun +3Deep Learning OptimizationMuon Optimizer

  10. An Improved Adaptive PID Optimizer with Enhanced Convergence and Stability for Deep Learning

    May 21, 2026Saurabh Saini, Kapil Ahuja, Thomas Wick +1Deep Learning OptimizationStochastic Optimization Convergence

  11. HORST: Composing Optimizer Geometries for Sparse Transformer Training

    May 20, 2026Tom Jacobs, Rohan Jain, Rebekka BurkholzDeep Learning OptimizationTransformer

  12. Ada2MS: A Hybrid Optimization Algorithm Based on Exponential Mixing of Elementwise and Global Second-Moment Estimates

    May 19, 2026Meng Zhu, Quan Xiao, Weidong MinDeep Learning OptimizationMomentum Methods

  13. SMA-DP: Spectral Memory-Aware Differential Privacy for Deep Learning

    May 19, 2026Mohammad Partohaghighi, Roummel MarciaDeep Learning OptimizationDifferentially Private Stochastic Gradient Descent

  14. Less Data, Faster Training: repeating smaller datasets speeds up learning via sampling biases

    May 19, 2026Jingwen Liu, Ezra Edelman, Surbhi Goel +1Deep Learning OptimizationStatistical Learning Theory

  15. StableGrad: Backward Scale Control without Batch Normalization

    May 19, 2026Jose I. Mestre, Alberto Fernández-Hernández, Cristian Pérez-Corral +2Deep Learning OptimizationNeural Network Training Dynamics

  16. MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models

    May 19, 2026Feihu Huang, Yuning Luo, Songcan ChenNeural Network GeneralizationDeep Learning Optimization

  17. Replacement Learning: Training Neural Networks with Fewer Parameters

    May 19, 2026Yuming Zhang, Peizhe Wang, Tianyang Han +5Deep Learning OptimizationNeural Network Compression

  18. Differentiable Optimization Layers for Guaranteed Fairness in Deep Learning

    May 16, 2026David Troxell, Noah Roemer, Guido MontúfarDeep Learning OptimizationAlgorithmic Fairness

  19. Does Weight Decay Enhance Training Stability?

    May 15, 2026Marius Saether, Amir Kolic, Tomaso Poggio +1Edge of StabilityDeep Learning Optimization

  20. Accelerated Gradient Descent for Faster Convergence with Minimal Overhead

    May 15, 2026Manuel Graca, L. Miguel Silveira, Arlindo Oliveira +1Deep Learning OptimizationGradient Descent

  21. Position: Zeroth-Order Optimization in Deep Learning Is Underexplored, Not Underpowered

    May 15, 2026Sijia Liu, Yicheng Lang, Soumyadeep Pal +6Deep Learning OptimizationZeroth-Order Optimization

  22. Rethinking Neural Network Learning Rates: A Stackelberg Perspective

    May 15, 2026Sihan Zeng, Sujay Bhatt, Sumitra GaneshDeep Learning OptimizationNeural Network Optimization

  23. Novel Dynamic Batch-Sensitive Adam Optimiser for Vehicular Accident Injury Severity Prediction

    May 14, 2026Daniel Asare Kyei, Alimatu Saadia-Yussiff, Maame G. Asante-Mensah +3Class-Imbalanced LearningDeep Learning Optimization

  24. Beyond What to Select: A Plug-and-play Oscillatory Data-Volume Scheduling for Efficient Model Training

    May 14, 2026Suorong Yang, Hanqi Zhu, Hai Gan +4Deep Learning OptimizationData Selection

  25. Efficient and provably convergent end-to-end training of deep neural networks with linear constraints

    May 12, 2026Zonglin Yang, Zhexuan Gu, Yancheng YuanDeep Learning OptimizationBackpropagation

  26. Error whitening: Why Gauss-Newton outperforms Newton

    May 11, 2026Maricela Best McKay, Nathan P. Lawrence, Brian Wetton +1Gauss-Newton OptimizationDeep Learning Optimization

  27. Muon is Not That Special: Random or Inverted Spectra Work Just as Well

    May 11, 2026Zakhar Shumaylov, Nathaël Da Costa, Peter Zaika +6Stochastic OptimizationDeep Learning Optimization

  28. Optimistic Dual Averaging Unifies Modern Optimizers

    May 11, 2026Thomas Pethick, Wanyun Xie, Roman Machacek +1Stochastic OptimizationDeep Learning Optimization

  29. Elucidating Representation Degradation Problem in Diffusion Model Training

    May 11, 2026Zhipeng Yao, Dazhou Li, Zitong Zhang +6Deep Learning OptimizationDiffusion Model Acceleration