Adaptive Gradient Methods

Latest papers 113

All topics
CardsList
  1. Why Muon Outperforms Adam: A Curvature Perspective

    Jun 3, 2026Shuche Wang, Fengzhuo Zhang, Jiaxiang Li +2Neural Network OptimizationMuon Optimizer

  2. Beyond Gradient Descent: Adam for Analog Ising Machines

    Jun 2, 2026Stijn Van Vooren, Guy Van der Sande, Guy VerschaffeltCombinatorial OptimizationAdaptive Gradient Methods

  3. MAdam: Metric-Aware Multi-Objective Adam

    Jun 2, 2026Fengbei Liu, Rachit Saluja, Sunwoo Kwak +5Adaptive Gradient MethodsMulti-Objective Optimization

  4. Stochastic convergence of parallel asynchronous adaptive first-order methods

    Jun 1, 2026Serge Gratton, Philippe L. TointStochastic OptimizationNonconvex Stochastic Optimization

  5. Rethinking Bregman Divergences in Kronecker-Factored Optimizers

    May 30, 2026Bing Liu, Wenjie Zhou, Chengcheng ZhaoSecond-Order OptimizationAdaptive Gradient Methods

  6. Convergence of Steepest Descent and Adam under Non-Uniform Smoothness

    May 28, 2026Sharan Vaswani, Yifan Sun, Reza BabanezhadOptimization Convergence AnalysisGradient Descent

  7. A Theoretical and Experimental Study of a Novel Adaptive Learning Algorithm

    May 28, 2026Sakshi Kumari, Shyam Kumar M, Sushmitha POptimization Convergence AnalysisStochastic Optimization Convergence

  8. Can Entry-Wise Clipping Give Spectral Control of Stochastic Gradients?

    May 26, 2026Zitao Song, Cedar Site Bai, Zhe Zhang +2Gradient ClippingHeavy-Tailed Noise

  9. PILOT: Policy-Informed Learned Optimization for Adaptive Deep Network Training

    May 23, 2026Sattam Altuuaim, Lama Ayash, Muhammad Mubashar +1Deep Learning OptimizationLearning to Optimize

  10. Non-normal spectral signatures of instability in neural network training dynamics

    May 22, 2026Souvik GhoshDynamical SystemsNeural Network Optimization

  11. An Improved Adaptive PID Optimizer with Enhanced Convergence and Stability for Deep Learning

    May 21, 2026Saurabh Saini, Kapil Ahuja, Thomas Wick +1Deep Learning OptimizationStochastic Optimization Convergence

  12. Ada2MS: A Hybrid Optimization Algorithm Based on Exponential Mixing of Elementwise and Global Second-Moment Estimates

    May 19, 2026Meng Zhu, Quan Xiao, Weidong MinDeep Learning OptimizationMomentum Methods

  13. From SGD to Muon: Adaptive Optimization via Schatten-p Norms

    May 19, 2026Thomas Massena, Corentin Friedrich, Mathieu SerrurierNeural Network OptimizationMuon Optimizer

  14. Understanding Dynamics of Adam in Zero-Sum Games: An ODE Approach

    May 19, 2026Yi Feng, Weiming Ou, Xiao WangZero-Sum GamesMin-Max Optimization

  15. Distance-Aware Muon: Adaptive Step Scaling for Normalized Optimization

    May 18, 2026Yury Demidovich, Abhishek Chakraborty, Grigory Malinovsky +2Muon OptimizerNonconvex Optimization

  16. AMO: Operator-level Adaptive Muon Orthogonalization

    May 18, 2026Xinlin Zhuang, Panyi Ouyang, Yichen Li +7Language Model PretrainingNewton-Schulz Iteration

  17. Novel Dynamic Batch-Sensitive Adam Optimiser for Vehicular Accident Injury Severity Prediction

    May 14, 2026Daniel Asare Kyei, Alimatu Saadia-Yussiff, Maame G. Asante-Mensah +3Class-Imbalanced LearningDeep Learning Optimization

  18. Adam-SHANG: A Convergent Adam-Type Method for Stochastic Smooth Convex Optimization

    May 13, 2026Yaxin Yu, Long Chen, Minfu FengStochastic OptimizationMomentum Methods

  19. PowerStep: Memory-Efficient Adaptive Optimization via ℓp\ell_p-Norm Steepest Descent

    May 11, 2026Yao Lu, Dengdong Fan, Shixun Zhang +1Gradient DescentMemory-Efficient Optimization

  20. Refresh-Scaling the Memory of Balanced Adam

    May 11, 2026Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre +2Deep Learning OptimizationMomentum Methods

  21. SURGE: Surrogate Gradient Adaptation in Binary Neural Networks

    May 9, 2026Haoyu Huang, Boyu Liu, Linlin Yang +6Binary Neural NetworksAdaptive Gradient Methods

  22. AdaPreLoRA: Adafactor Preconditioned Low-Rank Adaptation

    May 9, 2026Ziyun Liu, Fengmiao Bian, Jian-Feng CaiLow-Rank AdaptationAdaptive Gradient Methods

  23. AdamFLIP: Adaptive Momentum Feedback Linearization Optimization for Hard Constrained PINN Training

    May 8, 2026Binghang Lu, Runyu Zhang, Changhong Mou +2Neural PDE SolversConstrained Optimization

  24. PolarAdamW: Disentangling Spectral Control and Schur Gauge-Equivariance in Matrix Optimisation

    May 8, 2026Haozhou ZhangMuon OptimizerMatrix Optimization