Gradient Descent Dynamics

Latest papers 108

All topics
CardsList
  1. SGD at the Edge of Stability: The Stochastic Sharpness Gap

    Apr 22, 2026Fangshuo Liao, Afroditi Kolomvaki, Anastasios KyrillidisEdge of StabilityNeural Network Optimization

  2. The Origin of Edge of Stability

    Apr 22, 2026Elon LitmanEdge of StabilityGradient Descent

  3. Random Matrix Theory of Early-Stopped Gradient Flow: A Transient BBP Scenario

    Apr 20, 2026Florentin Coeurdoux, Grégoire Ferré, Jean-Philippe BouchaudRandom Matrix TheoryEarly Stopping

  4. Non-Euclidean Gradient Descent Operates at the Edge of Stability

    Mar 5, 2026Rustem Islamov, Michael Crawshaw, Jeremy Cohen +1Edge of StabilityGradient Descent Dynamics

  5. Gradient Flow Through Diagram Expansions: Learning Regimes and Explicit Solutions

    Feb 4, 2026Dmitry Yarotsky, Eugene Golikov, Yaroslav GusevTensor DecompositionMean-Field Theory

  6. Not All Preferences Deserve Gradients: Understanding Gradient Utility in Offline Reasoning Alignment

    Feb 1, 2026Hui Wu, Hengyi Cai, Jinman Zhao +6Pairwise Preference LearningTraining Data Selection

  7. Spectral Gradient Descent Mitigates Anisotropy-Driven Misalignment: A Case Study in Phase Retrieval

    Jan 30, 2026Guillaume Braun, Han Bao, Wei Huang +1Gradient DescentGradient Descent Dynamics

  8. Why β1=β2β_1 = β_2 Is Dynamically Special in Adam

    Jan 29, 2026Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre +2Momentum MethodsAdaptive Gradient Methods

  9. To Grok Grokking: Provable Grokking in Ridge Regression

    Jan 27, 2026Mingyue Xu, Gal Vardi, Itay SafranNeural Network GeneralizationRidge Regression

  10. Modified Loss of Momentum Gradient Descent: Fine-Grained Analysis

    Sep 10, 2025Matias D. Cattaneo, Boris ShigidaGradient Descent Dynamics

  11. On the Effectiveness of the z-Transform Method in Quadratic Optimization

    Jul 4, 2025Francis BachOptimization Convergence AnalysisGradient Descent Dynamics

  12. The Dynamics of Generalization in Deep Learning

    Apr 23, 2025Rubing Yang, Pratik ChaudhariNeural Network GeneralizationNeural Network Training Dynamics

  13. Gradient Descent on Logistic Regression with Non-Separable Data and Large Step Sizes

    Jun 7, 2024Si Yi Meng, Antonio Orvieto, Daniel Yiming Cao +1Dynamical SystemsLogistic Regression

  14. On Regularization via Early Stopping for Least Squares Regression

    Jun 6, 2024Rishi Sonthalia, Jackie Lok, Elizaveta RebrovaEarly StoppingLinear Regression