Adaptive Gradient Methods

Latest papers 113

All topics
CardsList
  1. Revisiting Adam for Streaming Reinforcement Learning

    May 7, 2026Florin Gogianu, Adrian Catalin Lutu, Razvan PascanuDistributional RLReinforcement Learning

  2. Directional Consistency as a Complementary Optimization Signal: The GONO Framework

    May 7, 2026Victor Daniel GeraDeep Learning OptimizationStochastic Optimization Convergence

  3. Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio

    May 7, 2026Ziqing Wen, Zhouyang Liu, Jiahuan Wang +4Deep Learning OptimizationLearning Rate Scheduling

  4. On Adaptivity in Zeroth-Order Optimization

    May 5, 2026Hassan Dbouk, Nidham Gazagnadou, Matthias Reisser +1Zeroth-Order OptimizationLLM Fine-Tuning

  5. FIBER: A Differentially Private Optimizer with Filter-Aware Innovation Bias Correction

    May 5, 2026Duc Dm, Thao Do, Minh Son Hoang +3Differentially Private Stochastic Gradient DescentPrivacy-Preserving ML

  6. Anon: Extrapolating Adaptivity Beyond SGD and Adam

    May 4, 2026Yiheng Zhang, Kaiyan Zhao, Shaowu Wu +5Nonconvex Stochastic OptimizationAdaptive Gradient Methods

  7. AdaMeZO: Adam-style Zeroth-Order Optimizer for LLM Fine-tuning Without Maintaining the Moments

    May 1, 2026Zhijie Cai, Haolong Chen, Guangxu ZhuMemory-Efficient Fine-TuningZeroth-Order Optimization

  8. Learning Rate Engineering: From Coarse Single Parameter to Layered Evolution

    Apr 30, 2026Ming-Hong Yao, Di Wang, Jian Cui +5Deep Learning OptimizationFine-Tuning

  9. NeuroPlastic: A Plasticity-Modulated Optimizer for Biologically Inspired Learning Dynamics

    Apr 29, 2026Douglas Jiang, Yuechen Wang, Jiayi Wang +3Neural Network OptimizationAdaptive Gradient Methods

  10. A unified convergence theory for adaptive first-order methods in the nonconvex case, including AdaNorm, full and diagonal AdaGrad, Shampoo and Muo

    Apr 19, 2026S. Gratton, Ph. L. TointMomentum MethodsNonconvex Stochastic Optimization

  11. Uniform a priori bounds and error analysis for the Adam stochastic gradient descent optimization method

    Mar 19, 2026Steffen Dereich, Thang Do, Arnulf JentzenStochastic OptimizationStochastic Optimization Convergence

  12. Why GRPO Needs Normalization: A Local-Curvature Perspective on Adaptive Gradients

    Jan 30, 2026Cheng Ge, Caitlyn Heqi Yin, Hao Liang +1RL for Language Model ReasoningGroup Relative Policy Optimization

  13. Why β1=β2β_1 = β_2 Is Dynamically Special in Adam

    Jan 29, 2026Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre +2Momentum MethodsAdaptive Gradient Methods

  14. Adam symmetry theorem: characterization of the convergence of the stochastic Adam optimizer

    Nov 10, 2025Steffen Dereich, Thang Do, Arnulf Jentzen +1Stochastic OptimizationStochastic Optimization Convergence

  15. Understanding and Improving Shampoo and SOAP via Kullback-Leibler Minimization

    Sep 3, 2025Wu Lin, Scott C. Lowe, Felix Dangel +3Deep Learning OptimizationNeural Network Optimization

  16. On the O(dK1/4)O(\frac{\sqrt{d}}{K^{1/4}}) Convergence Rate of AdamW Measured by ℓ1\ell_1 Norm

    May 17, 2025Huan Li, Yiming Dong, Zhouchen LinOptimization Convergence AnalysisStochastic Optimization Convergence

  17. Learning rate adaptive stochastic gradient descent optimization methods: numerical simulations for deep learning methods for partial differential equations and convergence analyses

    Jun 20, 2024Steffen Dereich, Arnulf Jentzen, Adrian RiekertStochastic Optimization ConvergenceAdaptive Gradient Methods

  18. Generalizing Adam to Manifolds for Efficiently Training Transformers

    May 26, 2023Benedikt BrantnerStiefel Manifold OptimizationRiemannian Optimization

  19. Adapt or Forget: Provable Tradeoffs Between Adam and SGD in Nonstationary Optimization

    Date pendingSharan Sahu, Abir Sarkar, Cameron J. Hogan +1Stochastic OptimizationStochastic Optimization Convergence