Momentum Methods

Latest papers 43

All topics
CardsList
  1. Muon meets Tamed Langevin: Momentum Preconditioning beyond Convex and gradient-Lipschitz Potentials

    Oct 1, 2026Nikolaos Makras, Sotirios SabanisMarkov Chain Monte CarloMomentum Methods

  2. Optimal Momentum Methods for Stochastic Multilevel Compositional Optimization

    Oct 1, 2026Wei Jiang, Rui Yan, Sifan Yang +3Stochastic OptimizationMomentum Methods

  3. Momentum in large-batch training: Polyak enlarges the critical batch size, Nesterov improves data efficiency

    Sep 2, 2026Jia-Nan Wang, Zixun Huang, Kairui Li +1Momentum MethodsGradient Descent

  4. Activation-Keyed Momentum: An Anisotropic Momentum Update via the Delta Rule

    Aug 19, 2026Euijin Hong, Guannan QuDeep Learning OptimizationMomentum Methods

  5. Momentum as Residual-Driven Multiplier Correction for Deep Learning Optimization

    Aug 13, 2026Zhixin Ren, Yau Lyu, Congrong Li +2Deep Learning OptimizationMomentum Methods

  6. Nesterov acceleration in optimizing over probability measures

    Jul 25, 2026Jiaqi Tang, Qin Li, Wilfrid GangboMomentum MethodsGradient Descent

  7. Muse: Representation Geometry of Muon Beyond Normalized Momentum

    Jul 16, 2026Da Chang, Qiankun Shi, Lvgang Zhang +4Representation GeometryMomentum Methods

  8. Heavy-Ball Q-Learning with Residual Weighting Correction

    Jun 25, 2026Donghwan LeeMomentum MethodsQ-Learning

  9. Compute Efficiency and Serial Runtime Tradeoffs for Stochastic Momentum Methods

    Jun 17, 2026Depen Morwani, Alexandru Meterez, Pranav Nair +1Stochastic OptimizationMomentum Methods

  10. CacheMuon: Using Temporal Preconditioning To Approximate Polar Factor

    Jun 15, 2026Bishnu Dev, Sushil Bohara, Martin Takáč +1Momentum MethodsNeural Network Optimization

  11. OptMuon: Closed-Loop Orthogonalized Momentum Methods for Stochastic Optimization with Zero-Noise Optimality

    Jun 7, 2026Ganzhao YuanMomentum MethodsNonconvex Stochastic Optimization

  12. Denoise First, Orthogonalize Later: Understanding Momentum in Muon via Spectral Filtering

    Jun 2, 2026Xianliang Li, Zihan Zhang, Weiyang Liu +1Deep Learning OptimizationMomentum Methods

  13. Spectral Scaling Laws of Muon

    Jun 2, 2026Gagik Magakyan, Pablo Parrilo, Asuman OzdaglarNewton-Schulz IterationMomentum Methods

  14. Dynamics of Stochastic Momentum with Sparse Updates in High Dimensions

    May 27, 2026Katie Everett, Elliot PaquetteMomentum MethodsGradient Descent Dynamics

  15. Outer-Momentum Restarting in High-Dimensional Two-Phase Optimization

    May 27, 2026Kristi Topollai, Allan Ma, Tolga Dimlioglu +2Momentum MethodsCommunication-Efficient Distributed Training

  16. Stochastic Gradient Descent with Momentum is Algorithmically Stable

    May 27, 2026Yunwen Lei, Zimeng Wang, Xiaoming YuanMomentum MethodsAlgorithmic Stability

  17. Momentum Streams for Optimizer-Inspired Transformers

    May 23, 2026Jingchu Gai, Nai-Chieh Huang, Jiayun WuDeep Learning OptimizationTransformer

  18. Move on Muon : A Hamiltonian probability gradient flow perspective of Muon optimizer

    May 22, 2026Aratrika Mustafi, Soumya Mukherjee, Bharath K. SriperumbudurMomentum MethodsMuon Optimizer

  19. Ada2MS: A Hybrid Optimization Algorithm Based on Exponential Mixing of Elementwise and Global Second-Moment Estimates

    May 19, 2026Meng Zhu, Quan Xiao, Weidong MinDeep Learning OptimizationMomentum Methods

  20. LionMuon: Alternating Spectral and Sign Descent for Efficient Training

    May 19, 2026Arman Bolatov, Artem Riabinin, Nikita Kornilov +4Stochastic OptimizationSign-Based Optimization

  21. Stochastic Compositional Optimization via Hybrid Momentum Frank--Wolfe

    May 14, 2026El Mahdi ChaytiStochastic OptimizationMomentum Methods

  22. Spectral Flattening Is All Muon Needs: How Orthogonalization Controls Learning Rate and Convergence

    May 13, 2026Tien-Phat Nguyen, Truong Nguyen, Minh-Phuc Truong +3Momentum MethodsGradient Descent

  23. Adam-SHANG: A Convergent Adam-Type Method for Stochastic Smooth Convex Optimization

    May 13, 2026Yaxin Yu, Long Chen, Minfu FengStochastic OptimizationMomentum Methods

  24. Refresh-Scaling the Memory of Balanced Adam

    May 11, 2026Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre +2Deep Learning OptimizationMomentum Methods

  25. Muon with Nesterov Momentum: Heavy-Tailed Noise and (Randomized) Inexact Polar Decomposition

    May 7, 2026Sayantan Choudhury, Xiaoran Cheng, Martin Takáč +2Stochastic OptimizationMomentum Methods