Gradient Descent Dynamics

Latest papers 108

All topics
CardsList
  1. What Makes a Strong Model? A Unified Spectral Analysis of Knowledge Transfer over High-dimensional Linear Regression

    May 31, 2026Wendao Wu, Fangqing Zhang, Haihan Zhang +1Weak-to-Strong GeneralizationTeacher-Student Learning

  2. Balancing Learning Rates Across Layers: Exact Two-Step Dynamics and Optimal Scaling in Linear Neural Networks

    May 29, 2026Tianyu Pang, Vignesh Kothapalli, Shenyang Deng +3Deep Learning OptimizationNeural Network Training Dynamics

  3. Gradient Descent with Large Step Size Restores Symmetry in Deep Linear Networks with Multi-Pathway

    May 29, 2026Hee-Sung Kim, Sungyoon LeeEdge of StabilitySymmetry Breaking

  4. Dynamics of Stochastic Momentum with Sparse Updates in High Dimensions

    May 27, 2026Katie Everett, Elliot PaquetteMomentum MethodsGradient Descent Dynamics

  5. Implicit Regularization in Perturbed Deep Matrix Factorization: Spectral Conditions and Stability

    May 27, 2026Jingzhe Wang, Hung-Hsu ChouAlgorithmic StabilityLow-Rank Matrix Decomposition

  6. Gradient-Flow Optimization as Dynamic Random-Effects Inference: Testing and Early Stopping with Applications to Deep Learning

    May 27, 2026Minhao Yao, Ruoyu Wang, Xihong Lin +2Early StoppingNeural Network Training Dynamics

  7. Asymmetric Scaling Laws from Sparse Features

    May 22, 2026John Sous, Michael WinerDouble DescentActivation Sparsity

  8. Why SGD is not Brownian Motion: A New Perspective on Stochastic Dynamics

    May 21, 2026Igor Ignashin, Anna Radovskaya, Andrew Semenov +7Neural Network Training DynamicsGradient Descent Dynamics

  9. Uniform-in-Time Weak Propagation-of-Chaos in Shallow Neural Networks

    May 21, 2026Margalit Glasgow, Joan BrunaShallow Neural NetworksMean-Field Theory

  10. Thermodynamic Irreversibility of Training Algorithms

    May 21, 2026Liu Ziyin, Yuanjie Ren, Adam Levine +1Neural Network Training DynamicsGradient Descent Dynamics

  11. Large-Step Training Dynamics of a Two-Factor Linear Transformer Model

    May 20, 2026Krishnakumar BalasubramanianTransformerPhase Transitions

  12. Understanding Dynamics of Adam in Zero-Sum Games: An ODE Approach

    May 19, 2026Yi Feng, Weiming Ou, Xiao WangZero-Sum GamesMin-Max Optimization

  13. Propagation of Chaos in Contextual Flow Maps

    May 16, 2026Shi Chen, Zhengjiang Lin, Kaizhao Liu +1TransformerGradient Descent Dynamics

  14. Metric-Gradient Projection for Stable Multi-Agent Policy Learning

    May 12, 2026Zuyuan Zhang, Sizhe Tang, Mahdi Imani +1Hodge DecompositionMulti-Agent Systems

  15. On the global convergence of gradient descent for wide shallow models with bounded nonlinearities

    May 11, 2026Romain Petit, Clarice Poon, Gabriel PeyréShallow Neural NetworksGradient Descent

  16. Dimension-Free Saddle-Point Escape in Muon

    May 10, 2026Yanlin Long, Yufei Gu, Zeke XieMuon OptimizerNonconvex Optimization

  17. The Global Empirical NTK: Self-Referential Bias and Dimensionality of Gradient Descent Learning

    May 9, 2026James Hazelden, Laura Driscoll, Eli Shlizerman +1Representation LearningNeural Tangent Kernel

  18. Distributional simplicity bias and effective convexity in Energy Based Models

    May 8, 2026Aurélien Decelle, Alfonso de Jesús Navas Gómez, Beatriz SeoaneEnergy-Based ModelsGradient Descent Dynamics

  19. The Weight Gram Matrix Captures Sequential Feature Linearization in Deep Networks

    May 7, 2026Taehun Cha, Daniel Beaglehole, Adityanarayanan Radhakrishnan +1Neural Network Training DynamicsGradient Descent Dynamics

  20. Learning reveals invisible structure in low-rank RNNs

    May 5, 2026Yoav Ger, Omri BarakNeural ProcessesRecurrent Neural Networks

  21. A Theory of Saddle Escape in Deep Nonlinear Networks

    May 2, 2026Divit Rawal, Michael R. DeWeeseNeural Network OptimizationNeural Network Training Dynamics

  22. High-Probability Convergence in Decentralized Stochastic Optimization with Gradient Tracking

    Apr 30, 2026Aleksandar Armacki, Haoyuan Cai, Ali H. SayedConvergence AnalysisStochastic Optimization Convergence

  23. Dynamic Scaled Gradient Descent for Stable Fine-Tuning for Classifications

    Apr 30, 2026Nghia Bui, Lijing WangFine-TuningGradient Descent Dynamics

  24. State-Dependent Lyapunov Analysis of Rank-1 Matrix Factorization

    Apr 28, 2026Jaehong MoonEdge of StabilityLyapunov Stability