Adaptive Gradient Methods

Latest papers 113

All topics
CardsList
  1. Learning from the Descent Direction: Adaptive Gradient Descent under One-Sided Hölder Regularity

    Jul 24, 2026Arzu Ahmadova, Ismail HuseynovLearning Rate SchedulingNonconvex Optimization

  2. Optimizing the Preconditioner: A Black-box Online-to-Nonconvex Conversion with Static Regret Minimization Oracles

    Jul 20, 2026Haichen Hu, David Simchi-LeviNonconvex Stochastic OptimizationAdaptive Gradient Methods

  3. FlexiGrad: Adaptive Gradient Modulation for Hierarchical Fine-Grained Classification

    Jul 20, 2026Zilu Zhou, Dongliang Chang, Junhan Chen +1Hierarchical ClassificationGradient Interference

  4. Reassessing Muon for Matrix Factorization

    Jul 14, 2026Ali Parviz, Gal Mishne, Alex CloningerDeep Learning OptimizationMuon Optimizer

  5. M+Adam: Low-Precision Training via Additive-Multiplicative Optimization

    Jul 12, 2026Xiaoyuan Liang, Sebastian Loeschcke, Mads Toftrup +1Quantization-Aware TrainingAdaptive Gradient Methods

  6. Unified convergence analysis for gradient descent optimization methods in the training of deep neural networks

    Jul 5, 2026Shokhrukh Ibragimov, Arnulf JentzenDeep Learning OptimizationNeural Network Optimization

  7. Directional Curvature from Armijo Backtracking: A Low-Cost Sharpness Probe and a Calibration-Free Learning-Rate Safeguard for Adam

    Jul 4, 2026Ashmitha R, Jörg FrochteGradient DescentAdaptive Gradient Methods

  8. On the Convergence of Adam, Revisited

    Jul 3, 2026Steven Heilman, Sampad MohantyOnline Convex OptimizationStochastic Optimization Convergence

  9. Characterizing Optimizer-Dependent Training Dynamics Through Hessian Eigenvector Displacement and Localization

    Jun 29, 2026Marcelina Marjankowska, Valerio Modugno, Paolo BaruccaSpectral MethodsAdaptive Gradient Methods

  10. Analysis of Adam Algorithms for Stochastic Dynamic Systems

    Jun 27, 2026Xin Zheng, Yifei Jin, Lei GuoStochastic OptimizationStochastic Optimization Convergence

  11. Open Problem: Is AdamW Effective Under Heavy-Tailed Noise?

    Jun 22, 2026Dingzhi Yu, Hongyi Tao, Yuanyu Wan +2Stochastic OptimizationHeavy-Tailed Noise

  12. Adam Converges in Nonsmooth Nonconvex Optimization

    Jun 21, 2026Zijian LiuHeavy-Tailed NoiseNonconvex Optimization

  13. Central limit theorem for the averaged Adam optimizer

    Jun 19, 2026Steffen Dereich, Arnulf JentzenStochastic ApproximationStochastic Optimization Convergence

  14. One-Step Generalization Ratio Guided Optimization for Domain Generalization

    Jun 15, 2026Sumin Cho, Dongwon Kim, Kwangsu KimDomain GeneralizationAdaptive Gradient Methods

  15. Schattor: Schatten-family methods for deep learning optimization

    Jun 14, 2026Bohao Ma, Junyu Zhang, Chuan HeDeep Learning OptimizationStochastic Optimization Convergence

  16. Beyond a Single Explanation of the Adam--SGD Gap

    Jun 12, 2026Chenxiang Zhang, Rustem Islamov, Enea Monzio Compagnoni +3Deep Learning OptimizationAdaptive Gradient Methods

  17. Gefen: Optimized Stochastic Optimizer

    Jun 11, 2026Nadav Benedek, Tomer Koren, Ohad FriedDeep Learning OptimizationMemory-Efficient Optimization

  18. Preserving Plasticity in Continual Learning via Dynamical Isometry

    Jun 8, 2026Andries Rosseau, Robert Müller, Ann NowéLoss of PlasticityContinual Learning

  19. Adaptive directional gradients for parameterised quantum circuits

    Jun 8, 2026Brian Coyle, Snehal Raj, Virag Umathe +2Variational Quantum CircuitsAdaptive Gradient Methods

  20. OptMuon: Closed-Loop Orthogonalized Momentum Methods for Stochastic Optimization with Zero-Noise Optimality

    Jun 7, 2026Ganzhao YuanMomentum MethodsNonconvex Stochastic Optimization

  21. Large-scale empirical tuning and comparison of default optimizers for variational inference

    Jun 5, 2026Trevor Campbell, Jonathan H. Huggins, Kyurae Kim +1Stochastic OptimizationBayesian Inference

  22. Flatland: The Adventures of Gradient Descent with Large Step Sizes

    Jun 4, 2026Leonardo Galli, Curtis Fox, Wiebke Bartolomaeus +2Edge of StabilityGradient Descent

  23. DP-MacAdam: Differentially Private Mechanism with Adaptive Clipping and Adaptive Momentum

    Jun 3, 2026Naima Tasnim, Lalitha Sankar, Oliver KosutDifferentially Private Stochastic Gradient DescentGradient Clipping