Gradient Descent Dynamics

Latest papers 108

All topics
CardsList
  1. PRAXIS: Learning Dynamics of Self-Improving Models with Symbolic Archives

    Oct 8, 2026Venkat Margapuri, Mustafa TeberSelf-Improving AgentsAdaptive Learning

  2. Rare Gate Disagreements Can Limit Plasticity: When Gradient Flow Mispredicts Finite-Batch SGD

    Oct 8, 2026Ruoyu Zhao, Mingxuan Zhang, Jianbo Dai +3Neural Network Training DynamicsStochastic Gradient Descent

  3. Finite-Sample Approximation of Hessian-Guided Perturbed Wasserstein Gradient Flows

    Oct 7, 2026Ryotaro Kawata, Atsushi Nitanda, Taiji SuzukiWasserstein Gradient FlowsGradient Descent Dynamics

  4. Global Exponential Convergence of Two-Layer Linear Network Training

    Oct 7, 2026Stephen Y Zhang, Gabriel PeyréNeural Network Training DynamicsGradient Descent Dynamics

  5. The Birkhoff Geometry of Manifold-Constrained Hyper-Connections: Two Channels, Vertex Viscosity, and Sinkhorn as a Retraction

    Oct 5, 2026Xiaoyu Li, Zhizhou Sha, Chiwun YangHyper-ConnectionsConstrained Optimization

  6. Universality and Convergence of Generative Flows

    Oct 4, 2026Leo BrunswicFlow MatchingGenerative Flow Networks

  7. Ideal Paths for Approximating Logistic Gradient Descent Trajectories at Large Initialization

    Oct 2, 2026Junjie Xiao, Huiwen JiaLogistic RegressionNeural Network Initialization

  8. Tight Transition Time Bounds for Separable Logistic Regression at the Edge of Stability

    Oct 1, 2026Haodong Wen, Kaiyue Wen, Jiaye TengEdge of StabilityLogistic Regression

  9. Least-time Gradient Flow

    Oct 1, 2026Alessandro Betti, Marco Gori, Stefano Melacci +1Optimal ControlGradient Descent Dynamics

  10. On the Two Faces of Adam in Separable Linear Classification

    Sep 27, 2026Chen Fan, Csaba SzepesváriImplicit BiasClassification

  11. Geometry of learning dynamics: Gradient descent versus natural gradient on the ridge of optimization

    Sep 15, 2026Akira TamamoriInformation GeometryGradient Descent

  12. A Theoretical Analysis of Generalization Dynamics in Neural Networks under Gradient Descent with Weight Decay

    Sep 7, 2026Yuqing Wang, Ioannis G. Kevrekidis, Mikhail BelkinNeural Network GeneralizationNeural Network Training Dynamics

  13. The Multiple Timescales of Gradient Descent on the Edge of Stability: A Perturbative Derivation of the Central Flow

    Sep 1, 2026Raphaël BerthierDynamical SystemsEdge of Stability

  14. Hard-ReLU Gradient Descent Selects an Event-Free Sensitivity Limit

    Aug 31, 2026Xiaoyang Li, Runni ZhouDynamical SystemsAutomatic Differentiation

  15. Reciprocity Separates Gradient Flow from Rotation in Conservative Physical Learning

    Aug 31, 2026Ruiwu Niu, Xiaowen Bi, Michaël Antonie van WykGradient Descent Dynamics

  16. Post-Grokking Collapse at the Representation-Readout Interface in Muon-Trained Transformers

    Aug 7, 2026Ali Janati, Kaoutar El Maghraoui, Anass BelfatmiTransformerMuon Optimizer

  17. Stochastic gradient descent with discontinuity across a manifold

    Aug 7, 2026Vivek S. BorkarStochastic ApproximationGradient Descent Dynamics

  18. Non-asymptotic implicit bias of logistic regression at early-stage gradient descent dynamics

    Aug 5, 2026Han BaoLogistic RegressionImplicit Bias

  19. Quotient Dynamics, Effective Curvature, and Implicit Bias in Positive Quadratic Networks

    Jul 28, 2026Pengcheng ChengRiemannian OptimizationImplicit Regularization

  20. Grokking on the Weight-Decay Clock: A Rate Hierarchy from Softly Broken Symmetries

    Jul 27, 2026Taeyoung KimNeural Network GeneralizationWeight Decay

  21. Mini-batch Noise Lowers Sharpness via Dominant-Subspace Fluctuations

    Jul 25, 2026Junho So, Dongwook ShinNeural Network Training DynamicsGradient Descent Dynamics

  22. Gradient Flow Dynamics and Implicit Bias of Diagonal Linear Networks under Infinitesimal Initialization

    Jul 14, 2026Jiajie Zhao, Jianxing Wang, Junjie Yang +2Deep Linear NetworksImplicit Bias

  23. LayerNorm as Implicit Gain Control in Looped Transformers

    Jul 12, 2026Matthias M. M. BuehlmaierRecurrent TransformersLayer Normalization

  24. Understanding Schedule-Free Methods in Nonconvex Optimization: Rate Guarantees and Escaping Saddles

    Jul 10, 2026Jiseok Chae, Donghwan KimLearning Rate SchedulingOptimization Convergence Analysis

  25. Dynamics of Gradient Descent with Large Step Size Near a Manifold of Flat Minima

    Jul 9, 2026Lachlan Ewen MacDonald, René VidalGradient DescentFlat Minima

  26. Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks

    Jul 8, 2026Yedi Zhang, Peter E. Latham, Leena Chennuru Vankadara +1Learning Rate SchedulingDeep Linear Networks