Stochastic Gradient Descent

Also known as SGD

Latest papers 132

All topics
CardsList
  1. Rare Gate Disagreements Can Limit Plasticity: When Gradient Flow Mispredicts Finite-Batch SGD

    Oct 8, 2026Ruoyu Zhao, Mingxuan Zhang, Jianbo Dai +3Neural Network Training DynamicsStochastic Gradient Descent

  2. Decentralized SGD under Heavy-Tailed Noise: Optimal Convergence Rates and the Role of Gradient Clipping

    Oct 7, 2026Aleksandar Armacki, Haoyuan Cai, Ali H. SayedDecentralized OptimizationStochastic Gradient Descent

  3. A Solvable Model of Adaptive Learning Rate Rescaling: Acceleration, Stability & Scaling

    Oct 5, 2026Itay Lavie, Clarissa Lauditi, Cengiz PehlevanEdge of StabilityNeural Scaling Laws

  4. Finite-Sample Distribution Theory and Efficient Large-Scale Inference for Online Quantile Regression

    Oct 5, 2026Ziyang Wei, Jiaqi Li, Lan Wang +1Quantile RegressionEfficient Inference

  5. Learning the identity: a case study of how SGD selects among functional decompositions

    Sep 30, 2026Andy Arditi, Weian Xie, David Bau +1Deep Linear NetworksImplicit Bias

  6. From Spectra to Joint Schedules in LLM Pre-training: 3+3(+2) Scaling-Law Regimes

    Sep 30, 2026Yichen Wang, Fanghui Liu, Yudong ChenLanguage Model PretrainingDeep Learning Optimization

  7. Robustifying Asynchronous SGD via Soft Throttling

    Sep 30, 2026Kaoru Otsuka, Maxime Meyer, Yuki Takezawa +2Distributed OptimizationFault-Tolerant Distributed Training

  8. AutoLoCo: Communication Efficient Distributed LLM Training via Adaptive Synchronization

    Sep 29, 2026Pengyu He, Yan Zhang, Ruien Li +1Communication-Efficient Distributed TrainingDistributed Training

  9. Precise Convergence Speed of Clipped SGD

    Sep 24, 2026David A. R. RobinGradient ClippingNonconvex Stochastic Optimization

  10. Resource-Adaptive Stochastic Gradient Descent for Online Linear Programming without Re-solving

    Sep 23, 2026Jiameng LyuOnline Convex OptimizationOnline Resource Allocation

  11. Same Flow, Different Paths: Variance Reduction in Flow Matching

    Sep 15, 2026Alexander TyurinFlow MatchingStochastic Optimization Convergence

  12. Convergence of Stochastic Gradient Methods under Heavy-Tailed Noise and H"{o}lder Smoothness

    Sep 14, 2026Misbah Uz Zaman, Anirbit MukherjeeGradient ClippingNonconvex Stochastic Optimization

  13. Quantile-based Loss Filtering for Outlier-Robust Stochastic Gradient Descent

    Sep 14, 2026Jamie Haddock, Anna Ma, Elizaveta RebrovaStochastic OptimizationStochastic Optimization Convergence

  14. Stochastic Gradient Descent over P2

    Sep 11, 2026Maria Oprea, Qin Li, Yunan YangStochastic OptimizationStochastic Gradient Descent

  15. Almost Sure Convergence Analysis of Stochastic Gradient Methods with Clipping and Additive Noise

    Sep 10, 2026Amartya Mukherjee, Jun LiuStochastic OptimizationGradient Clipping

  16. The Exact Time-Uniform Rate Frontier for Stochastic Gradient Descent on Smooth Convex Objectives

    Sep 8, 2026Ruijie Li, Kang Chen, Tianyu WangLearning Rate SchedulingLast-Iterate Convergence

  17. Speed Limit for Information Acquisition in Stochastic Learning Dynamics

    Sep 8, 2026Shuta Kobayashi, Andreas DechantNeural Network Training DynamicsInformation-Theoretic Lower Bounds

  18. SGD in Multiclass Logistic Regression: Sequential Learning and Scaling Laws

    Sep 7, 2026Konstantinos Christopher Tsiolis, Denny Wu, Christos Thrampoulidis +1Logistic RegressionMulticlass Classification

  19. Percolation Dynamics in Optimization: Variance Cascades and Nested Symmetry

    Sep 2, 2026Sai Niranjan Ramachandran, Suvrit SraStochastic Gradient DescentAdaptive Gradient Methods

  20. Adaptive Bregman Proximal Stochastic Gradient with a Stabilized Barzilai--Borwein Step Size

    Aug 12, 2026Chenhan Jin, Shengze Xu, Binghui Xie +4Nonconvex Stochastic OptimizationAdaptive Gradient Methods

  21. Generalized Convexity and Smoothness via Conjugate Duality: Optimization Theory for Deep Neural Networks

    Aug 10, 2026Binchuan QiGradient DescentNeural Network Optimization

  22. Stochastic gradient descent with discontinuity across a manifold

    Aug 7, 2026Vivek S. BorkarStochastic ApproximationGradient Descent Dynamics