Gradient Descent Dynamics

Latest papers 108

All topics
CardsList
  1. Stability Annealing Selects the Implicit Bias of Smoothed Sign Descent: A Rate-Indexed Barrier Path on Separable Data

    Jul 7, 2026Xiangwu Wang, Chengwei Cao, Yicheng Song +2Sign-Based OptimizationImplicit Regularization

  2. Unified convergence analysis for gradient descent optimization methods in the training of deep neural networks

    Jul 5, 2026Shokhrukh Ibragimov, Arnulf JentzenDeep Learning OptimizationNeural Network Optimization

  3. Directional Curvature from Armijo Backtracking: A Low-Cost Sharpness Probe and a Calibration-Free Learning-Rate Safeguard for Adam

    Jul 4, 2026Ashmitha R, Jörg FrochteGradient DescentAdaptive Gradient Methods

  4. Direction-Magnitude Decomposition for Low-Rank Matrix Optimization: Faster Convergence and Saddle-to-saddle Dynamics

    Jun 30, 2026Yudong Wei, Liang Zhang, Bingcong Li +1Low-Rank Matrix DecompositionNonconvex Optimization

  5. Predictable GRPO: A Closed-Form Model of Training Dynamics

    Jun 29, 2026Rajat Ghosh, Datta Nimmaturi, Aryan Singhal +4Group Relative Policy OptimizationPolicy Optimization

  6. Why can genetic algorithms work in high-dimensional search spaces?

    Jun 29, 2026Stephen WhitelamEvolutionary OptimizationGradient Descent Dynamics

  7. How Complexity Contributes to Learning Opacity in Machine Learning

    Jun 23, 2026Joachim Stein, Eric RaidlNeural Network Training DynamicsGradient Descent Dynamics

  8. Asymptotic Signal Subspace Recovery in Softmax Attention Models

    Jun 21, 2026Lan V. TruongSoftmax AttentionGradient Descent Dynamics

  9. Gradient-Descent Steps to Success over Mean Accuracy: A Paradigm Shift for ML

    Jun 20, 2026Riccardo Poli, Ahmet YilmazAutomated Machine LearningHyperparameter Optimization

  10. Finite-Sample Performance of Gradient Descent in Logistic Regression with Gaussian Design

    Jun 19, 2026Junren Chen, Arya MazumdarLogistic RegressionGradient Descent

  11. Conservation Laws for Modern Neural Architectures

    Jun 16, 2026Viet-Hoang Tran, Vinh Khanh Bui, Tan Lai Ngoc +3Neural Network Training DynamicsMulti-Head Attention

  12. SDS-LoRA: Overcoming Anisotropic Gradient Scaling in Low-Rank Adaptation

    Jun 15, 2026Junghun Oh, Sungyong Baik, Kyoung Mu LeeLow-Rank AdaptationParameter-Efficient Fine-Tuning

  13. Mirror Descent Beyond Euclidean Stability: An Exponential Separation in Initialization Sensitivity

    Jun 9, 2026Shira Vansover-Hager, Matan Schliserman, Ofir Schlisselberg +1Algorithmic StabilityMirror Descent

  14. The Spectral Dynamics and Noise Geometry of Muon

    Jun 7, 2026Pierfrancesco Beneventano, Mahmoud Abdelmoneum, Tomaso PoggioMuon OptimizerMatrix Optimization

  15. Generalization in Deep Neural Networks: Minimax Rates for Gradient Methods

    Jun 4, 2026Junyu Zhou, Puyu Wang, Yunwen Lei +2Neural Network GeneralizationGradient Descent Dynamics

  16. Flatland: The Adventures of Gradient Descent with Large Step Sizes

    Jun 4, 2026Leonardo Galli, Curtis Fox, Wiebke Bartolomaeus +2Edge of StabilityGradient Descent

  17. A prism hierarchy of learning regimes in large linear autoencoders

    Jun 3, 2026Eugene Golikov, Yaroslav Gusev, Dmitry YarotskyAutoencodersNeural Network Training Dynamics

  18. Mean--Fluctuation Dynamics at the Edge of Stability

    Jun 3, 2026Antonin Chodron de CourcelEdge of StabilityGradient Descent Dynamics

  19. When Both Layers Learn: Training Dynamics of Representing Linear Models via ReLU Networks

    Jun 3, 2026Berk Tinaz, Changzhi Xie, Mahdi SoltanolkotabiReLU Neural NetworksNeural Network Optimization

  20. Denoise First, Orthogonalize Later: Understanding Momentum in Muon via Spectral Filtering

    Jun 2, 2026Xianliang Li, Zihan Zhang, Weiyang Liu +1Deep Learning OptimizationMomentum Methods