Gradient Descent

Momentum

21 papers in the last four weeks, up 133% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 151

All topics
CardsList
  1. Tight Transition Time Bounds for Separable Logistic Regression at the Edge of Stability

    Oct 1, 2026Haodong Wen, Kaiyue Wen, Jiaye TengLogistic RegressionOptimal Sample Complexity

  2. CAGE-NAS: Certified Functional Descent for Efficient Model Growth

    Oct 1, 2026Santiago Florido Gomez, Stéphane RivaudNeural Architecture SearchNeural Network

  3. Principal Component Regression Dominates all Monotone Spectral Filters for Linear Regression

    Sep 30, 2026Juno Kim, Hengyu Fu, Peter Bartlett +2Kernel Ridge RegressionSpectral Filtering

  4. On the Two Faces of Adam in Separable Linear Classification

    Sep 27, 2026Chen Fan, Csaba SzepesváriAdamGradient Descent

  5. Benign Overfitting for General Norms and Distributions

    Sep 27, 2026Daniel Barzilai, Ohad ShamirOverfittingSpectral Norm

  6. Local LMO is Secretly a Projection Method!

    Sep 27, 2026Peter Richtárik, Ammar MahranConvex OptimizationProjection

  7. Precise Convergence Speed of Clipped SGD

    Sep 24, 2026David A. R. RobinGradient DescentConvergence

  8. Complexities of Weak Proximal Oracle Methods for Composite Convex Optimization

    Sep 21, 2026Dan GarberFirst Order Oracle ComplexityStochastic Convex Optimization

  9. Gradient Descent with Stochastic Subspaces via Persistence of Memory

    Sep 16, 2026Subhroshekhar Ghosh, Clement Z. Q. Ng, Pierre-Louis Poirion +1Stochastic Gradient DescentGradient Descent

  10. Geometry of learning dynamics: Gradient descent versus natural gradient on the ridge of optimization

    Sep 15, 2026Akira TamamoriGradient DescentShape Optimization

  11. Federated stochastic bilevel optimization with fully first-order gradients

    Sep 14, 2026Yihan Zhang, Rohit Dhaipule, Chiu C Tan +2Bilevel OptimizationGradient Descent

  12. Compute-Optimal Pretrain--Fine-tune in Ridge Gradient Descent

    Sep 14, 2026Alex Buna, Fanghui Liu, Patrick RebeschiniPretrainingModel Fine-Tuning

  13. Benign Loss Landscapes Can Coexist with Worst-Case Hardness

    Sep 14, 2026Zach Furman, Stephan Wäldchen, Yangda Bei +1Anisotropic Loss LandscapesTensor Networks

  14. Quantile-based Loss Filtering for Outlier-Robust Stochastic Gradient Descent

    Sep 14, 2026Jamie Haddock, Anna Ma, Elizaveta RebrovaConvex LossStochastic Gradient Descent

  15. AdamX: Cosine similarity meets gradient descent

    Sep 10, 2026Francisco Caldas, Ruben Belo, Cláudia SoaresAdamGradient Descent

  16. Generalization Analysis of Distributed Kernel-based Robust Gradient Descent Algorithms

    Sep 10, 2026Jun-Yi Meng, Zheng-Chu Guo, Yuan MaoDistributionally-Robust OptimizationStochastic Gradient Descent

  17. Why shared attention vectors fail: a case for outcome-indexed tuning

    Sep 8, 2026Lenard DomeAttention LayersLinear Attention

  18. A Theoretical Analysis of Generalization Dynamics in Neural Networks under Gradient Descent with Weight Decay

    Sep 7, 2026Yuqing Wang, Ioannis G. Kevrekidis, Mikhail BelkinTwo-Layer Neural NetworksGeneralization Bounds

  19. The Multiple Timescales of Gradient Descent on the Edge of Stability: A Perturbative Derivation of the Central Flow

    Sep 1, 2026Raphaël BerthierGradient DescentGradient

  20. Generalization as a robust performance property of learning-enabled dynamical systems

    Aug 31, 2026Filippo FabianiLearning DynamicsGeneralization Bounds

  21. Neural Quadratic Forms: A Unified Minimal Model for Sudden Learning and Scaling Laws

    Aug 13, 2026Liu Ziyin, Yizhou Xu, Tomaso Poggio +1Two-Layer Neural NetworksMultilayer Perceptrons

  22. Efficient Hypergradient Descent for Inverse Reinforcement Learning

    Aug 11, 2026Nikita Sevriukov, Anna Barabanova, Uliana Gagarina +4Offline Reinforcement LearningReward Functions

  23. A lower bound for stepsize-based acceleration of gradient descent

    Aug 11, 2026Jianhao Ma, Yuxin ChenStep AccuracyGradient Descent

  24. Generalized Convexity and Smoothness via Conjugate Duality: Optimization Theory for Deep Neural Networks

    Aug 10, 2026Binchuan QiGradient DescentSmoothness

  25. Minimax Optimal Early-Stopped Gradient Descent for Gaussian Mixture Classification

    Aug 6, 2026Alex Buna, Shirley Xiaoqi Liu, Patrick RebeschiniEmpirical Risk MinimizationGaussian Mixture Models

  26. Non-asymptotic implicit bias of logistic regression at early-stage gradient descent dynamics

    Aug 5, 2026Han BaoGradient DescentOverparameterization

  27. Adversarial Deepfake Generation and an Investigation of Purification-Based Adversarial Detection

    Jul 28, 2026Junghyun Kim, Seunghyun Kim, Jiyoung WooDeepfake DetectionUnsupervised Detection

  28. Extracting Voice Styles from Frozen TTS Models via Gradient-Based Inverse Optimization

    Jul 28, 2026Gyeongmin KimText-To-Speech SynthesisWav2Vec

  29. Global Convergence of DGM and PINN Algorithms for Solving Nonlinear PDEs

    Jul 27, 2026Justin Sirignano, Konstantinos Spiliopoulos, Samuel CohenPartial Differential EquationsVariational Formulation

  30. Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning

    Jul 26, 2026Minh Vu, Konstantinos SlavakisOffline Reinforcement LearningValue Functions

  31. Learning from the Descent Direction: Adaptive Gradient Descent under One-Sided Hölder Regularity

    Jul 24, 2026Arzu Ahmadova, Ismail HuseynovGradient DescentDescent

  32. Beyond Negative-Ridge Endpoints: Mixed-Sign Spectral Regularization via Negative-Shifted Gradient Descent

    Jul 24, 2026Peng ZhaoRegularizationQuadratic Slack Penalty

  33. Complexity Bounds and Approaches to Learning Projected Gradient Descent Solver Iterates

    Jul 24, 2026Anjian Li, Ryne BeesonGradient DescentSolver Iterations

  34. Energy Manifold Natural Gradient Descent: Riemannian Optimization for Neural PDE Solvers

    Jul 24, 2026Zhangyong Liang, Huanhuan GaoNeural Partial Differential Equation SolversRiemannian Optimization

  35. Optimizing Regret

    Jul 21, 2026Irene AldridgeRegretPolicy Gradient

  36. Enhanced Neural Quantum State via Annealed Gradient Descent

    Jul 21, 2026Shiwei Zhou, Yiming Huang, Xiao Yuan +1AnnealingPost-Quantum Cryptography

  37. Domain Adaptation of Mismatched Proximal Denoiser for Plug-and-Play Image Reconstruction

    Jul 16, 2026Guixian Xu, Jinglai Li, Junqi TangGaussian DeblurringImage Reconstruction

  38. Gradient Flow Dynamics and Implicit Bias of Diagonal Linear Networks under Infinitesimal Initialization

    Jul 14, 2026Jiajie Zhao, Jianxing Wang, Junjie Yang +2Gradient Descent

  39. LayerNorm as Implicit Gain Control in Looped Transformers

    Jul 12, 2026Matthias M. M. BuehlmaierBatch NormalizationRecurrent Model

  40. Sharper Analysis of Single-Loop Methods for Bilevel Optimization

    Jul 11, 2026Yubo Zhou, Jun Shu, Luo Luo +4Bilevel OptimizationConvergence

  41. Dynamics of Gradient Descent with Large Step Size Near a Manifold of Flat Minima

    Jul 9, 2026Lachlan Ewen MacDonald, René VidalGradient DescentHessian

  42. Hybrid Least Squares/Gradient Descent Methods for MIONets

    Jul 8, 2026Jun Choi, Chang-Ock Lee, Minam MoonGradient DescentLeast Squares

  43. Converge to Surprise: Evolutionary Self-supervised Image Clustering

    Jul 8, 2026Canlin Zhang, Xiuwen LiuClusteringDeep Learning

  44. Differentially Private Natural Gradient Descent

    Jul 7, 2026Pan Li, Kai Chen, Shuai Chang +3Standard Differential-PrivacyStochastic Gradient Descent

  45. Unified convergence analysis for gradient descent optimization methods in the training of deep neural networks

    Jul 5, 2026Shokhrukh Ibragimov, Arnulf JentzenNeural Network OptimizationGradient Descent

  46. Why can genetic algorithms work in high-dimensional search spaces?

    Jun 29, 2026Stephen WhitelamGenetic AlgorithmsGradient Descent

  47. ITSPACE: Monotone Gaussian Optimal Transport Updates

    Jun 29, 2026Woojoo Na, Jennifer DyCovarianceLatent Representation Alignment