Momentum Stochastic Gradient Descent

Momentum

3 papers in the last four weeks, level with the four weeks before. 0.0% of all new papers.

Jul 6Week of Sep 21

Latest papers 38

All topics
CardsList
  1. Convergence Analysis of STORM Under Different Geometries

    Oct 1, 2026Wei Jiang, Yibo Wang, Wenhao Yang +3Stochastic Convex OptimizationConvex Optimization

  2. The Hidden Ratio in Adam: Stable Structure, Compression, and Sign Dynamics

    Sep 28, 2026Yihe Zhou, Tongtian Zhu, Yingxiao Huo +4AdamMomentum Stochastic Gradient Descent

  3. MomWorld: Momentum-Aware Latent World Model for Long-Horizon Autonomous Driving

    Sep 27, 2026Ziying Song, Shengkai Zhang, Lei Yang +6Long-Horizon PlanningLatent World Models

  4. ZO-COSMO: Index-Free One-Hop Mixing for Decentralized Zeroth-Order Optimization

    Sep 23, 2026Shengjun Zhang, Tingyi Liu, Heng Zhang +1Momentum Stochastic Gradient Descent

  5. ReMoMask-2: Latent Retrieval-Augmented Masked Motion Generation

    Sep 8, 2026Yiran Wang, Zeyu Zhang, Ling Shao +1Text-To-Motion GenerationNeural Mask Estimation

  6. Activation-Keyed Momentum: An Anisotropic Momentum Update via the Delta Rule

    Aug 19, 2026Euijin Hong, Guannan QuMomentum Stochastic Gradient DescentMomentum

  7. Second Order Drifting Models

    Aug 8, 2026Drake Brown, Yuhao Huang, Shih-Hsin Wang +1Generative ModelsMomentum Stochastic Gradient Descent

  8. Nesterov acceleration in optimizing over probability measures

    Jul 25, 2026Jiaqi Tang, Qin Li, Wilfrid GangboMomentum Stochastic Gradient DescentProbability Measures

  9. Compute Efficiency and Serial Runtime Tradeoffs for Stochastic Momentum Methods

    Jun 17, 2026Depen Morwani, Alexandru Meterez, Pranav Nair +1Stochastic Gradient DescentMomentum Stochastic Gradient Descent

  10. Scaling Adaptive Depth with Norm-Agnostic Residual Networks

    Jun 15, 2026Tomás Figliolia, Beren MillidgeResidual NetworksScaling

  11. A Three-Layer Framework for AI in Scientific Discovery

    Jun 11, 2026Guojun LiaoScientific DiscoveryDiscovery

  12. OptMuon: Closed-Loop Orthogonalized Momentum Methods for Stochastic Optimization with Zero-Noise Optimality

    Jun 7, 2026Ganzhao YuanMuonMomentum Stochastic Gradient Descent

  13. ReSGA: A Large Tail Risk Model for Learning Value-at-Risk and Expected Shortfall

    Jun 3, 2026Yichi Zhang, Ke Zhu, Zhoufan ZhuConditional-Value-At-RiskLong-Tailed Distribution

  14. Dynamics of Stochastic Momentum with Sparse Updates in High Dimensions

    May 27, 2026Katie Everett, Elliot PaquetteMomentum Stochastic Gradient DescentMomentum

  15. EMA-Nesterov: Stabilizing Nesterov's Lookahead for Accelerated Deep Learning Optimization

    May 25, 2026Chung-Yiu Yau, Dawei Li, Athanasios Glentis +3Momentum Stochastic Gradient DescentNeural Network Optimization

  16. Ada2MS: A Hybrid Optimization Algorithm Based on Exponential Mixing of Elementwise and Global Second-Moment Estimates

    May 19, 2026Meng Zhu, Quan Xiao, Weidong MinAdamMomentum Stochastic Gradient Descent

  17. MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models

    May 19, 2026Feihu Huang, Yuning Luo, Songcan ChenMuonMomentum Stochastic Gradient Descent

  18. Stochastic Compositional Optimization via Hybrid Momentum Frank--Wolfe

    May 14, 2026El Mahdi ChaytiStochastic Convex OptimizationStochastic Optimization

  19. A Unified Lyapunov-IQC Framework for Uniform Stability of Smooth Quadratic First-Order Accelerated Optimizers

    May 8, 2026Don Li, Dacian DaescuLyapunov FunctionMomentum Stochastic Gradient Descent

  20. Muon with Nesterov Momentum: Heavy-Tailed Noise and (Randomized) Inexact Polar Decomposition

    May 7, 2026Sayantan Choudhury, Xiaoran Cheng, Martin Takáč +2Momentum Stochastic Gradient DescentMuon

  21. MDN: Parallelizing Stepwise Momentum for Delta Linear Attention

    May 7, 2026Yulong Huang, Xiang Liu, Hongxiang Huang +5Kimi Delta AttentionLinear Attention

  22. SignMuon: Communication-Efficient Distributed Muon Optimization

    May 4, 2026Neel Mishra, Kushagara Trivedi, Pawan KumarMuonDecentralized Optimization

  23. Randomized Subspace Nesterov Accelerated Gradient

    May 1, 2026Gaku Omiya, Pierre-Louis Poirion, Akiko TakedaMomentum Stochastic Gradient DescentFirst Order Oracle Complexity

  24. Inference of Online Newton Methods with Nesterov's Accelerated Sketching

    Apr 25, 2026Haoxuan Wang, Xinchen Du, Sen NaNewtonMomentum Stochastic Gradient Descent

  25. Adaptive Momentum and Nonlinear Damping for Neural Network Training

    Jan 30, 2026Aikaterini Karoni, Rajit Rajpal, Benedict Leimkuhler +1Momentum Stochastic Gradient DescentNeural Network Training

  26. A Nesterov-Accelerated Byzantine-Robust Federated Learning

    Nov 4, 2025Lihan Xu, Xiaoyi Fan, Gang Wang +3Byzantine AttacksFederated Learning

  27. Better Convergence Guarantees for Sign-Based Momentum Methods

    Jul 16, 2025Wei Jiang, Dingzhi Yu, Sifan Yang +3Momentum Stochastic Gradient DescentConvergence

  28. On the Effectiveness of the z-Transform Method in Quadratic Optimization

    Jul 4, 2025Francis BachMomentum Stochastic Gradient DescentConvergence

  29. Scaling Textual Gradients via Sampling-Based Momentum

    May 31, 2025Zixin Ding, Junyuan Hong, Zhan Shi +6Large Language Model TrainingAutomatic Prompt Optimization

  30. How Learning Dynamics Drive Adversarially Robust Generalization?

    Oct 10, 2024Yuelin Xu, Xiao ZhangAdversarial TrainingGeneralization Bounds

  31. Accelerated Stochastic Min-Max Optimization Based on Bias-corrected Momentum

    Jun 18, 2024Haoyuan Cai, Sulaiman A. Alghunaim, Ali H. SayedStochastic Convex OptimizationConvex Optimization