Descent

Momentum

3 papers in the last four weeks, with none the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 31

All topics
CardsList
  1. LionMuon: Alternating Spectral and Sign Descent for Efficient Training

    Sep 28, 2026Arman Bolatov, Artem Riabinin, Nikita Kornilov +4MuonDescent

  2. Double Descent and Malign Overfitting in Diffusion Models

    Sep 22, 2026Raphaël Urfin, Tony Bonnaire, Giulio Biroli +1OverfittingOverparameterization

  3. Double descent is the principle of least action

    Sep 16, 2026Congzhou M ShaDescentWeight Decay

  4. Hyper-ES: Effective Evolution Strategies for LLM Reasoning via Descent Direction Merging

    Aug 6, 2026Yu Gu, Zhi Zheng, Yunpeng Ba +3LLM Reasoning StrategiesEvolutionary Optimization Methods

  5. Double Descent in Gradient Boosting Decision Trees via Split-Candidate Scaling

    Aug 4, 2026Ryuichi KanohGradient Boosted Decision TreeDecision Trees

  6. Non-KKT Accumulation in Entropic Mirror Descent

    Aug 3, 2026Kuangyu Ding, Kim-Chuan TohMirror DescentDescent

  7. Code Is the Body: Agent-Owned Software Bodies for Recursive Evolution and Descent

    Jul 30, 2026Roy Zhao, Zhenyu ZhaoSelf-Evolving AgentsSelf-Evolution

  8. Origins and mitigation of double descent in reduced order modeling

    Jul 29, 2026Andrei A. Klishin, J. Nathan Kutz, Krithika ManoharReconstruction ErrorDescent

  9. Learning from the Descent Direction: Adaptive Gradient Descent under One-Sided Hölder Regularity

    Jul 24, 2026Arzu Ahmadova, Ismail HuseynovGradient DescentDescent

  10. Cautious optimism for deep parameterized quantum circuits

    Jul 23, 2026Marie Kempkes, Elies Gil-Fuster, Carlos Bravo-Prieto +5Quantum Machine LearningQuantum Circuits

  11. TwistedMerge: Certified Higher-Order Diagnostics and Abstention for Model Merging

    Jul 23, 2026Ting Gong, Shitan XuContinual Model MergingMerge

  12. Benign Overfitting Does Not Occur in Diffusion Models

    Jul 2, 2026Tyler Farghly, Benjamin Dupuis, Alain Durmus +1OverfittingScore-Based Diffusion Model

  13. End-to-End Control of a Powered Knee-Ankle Prosthesis Towards Unified, Tuning-Free Assistance

    Jun 5, 2026John Shim, Christoph Nuesslein, Sixu Zhou +3Abox Abduction ProblemFeet

  14. Trust Region Q Adjoint Matching

    May 26, 2026Yonghoon Dong, Kyungmin Lee, Changyeon Kim +2Flow PoliciesQ-Learning

  15. Two Speeds of Learning: A Representation-Readout Decomposition of Grokking and Double Descent

    May 26, 2026Chi-Ning Chou, Oscar Uzdelewicz, Neng-Chun Chiu +2GrokkingDescent

  16. The Stability of Singular Distribution: A Spectral Perspective on the Two-Phase Dynamics of Language Model Pre-training

    May 26, 2026Hongtao Zhang, Wenjie Zhou, Chenxi Jia +2Large Language Model PretrainingPretraining

  17. LionMuon: Alternating Spectral and Sign Descent for Efficient Training

    May 19, 2026Arman Bolatov, Artem Riabinin, Nikita Kornilov +4MuonDescent

  18. Adynamical systems view of training generativemodels and the memorization phenomenon

    May 19, 2026Siva Athreya, Chiranjib Bhattacharya, Vivek S. BorkarStochastic Gradient DescentMemorization

  19. Understanding Dynamics of Adam in Zero-Sum Games: An ODE Approach

    May 19, 2026Yi Feng, Weiming Ou, Xiao WangAdamImperfect-Information Games

  20. Large Dimensional Kernel Ridge Regression: Extending to Product Kernels

    May 14, 2026Yang Zhou, Yicheng Li, Yuqian Cheng +1Kernel Ridge RegressionKernel Method

  21. On the global convergence of gradient descent for wide shallow models with bounded nonlinearities

    May 11, 2026Romain Petit, Clarice Poon, Gabriel PeyréGradient DescentFlat Minima

  22. When Descent Is Too Stable: Event-Triggered Hamiltonian Learning to Optimize

    May 7, 2026Yi Wang, Chandrajit BajajConvex OptimizationDescent

  23. Dynamic Scaled Gradient Descent for Stable Fine-Tuning for Classifications

    Apr 30, 2026Nghia Bui, Lijing WangGradient DescentModel Fine-Tuning

  24. Decoupled Descent: Exact Test Error Tracking Via Approximate Message Passing

    Apr 30, 2026Max LovigDescent1B Parameters

  25. A Mechanism Study of Delayed Loss Spikes in Batch-Normalized Linear Models

    Apr 18, 2026Peifeng Gao, Wenyi Fang, Yang Zheng +1Batch NormalizationBatch

  26. Descent Before Hardness: Orbit-Gap Obstructions in Exact Certification

    Apr 8, 2026Tristan SimasTractabilityCertification

  27. Asymptotic Behavior of Multi--Task Learning: Implicit Regularization and Double Descent Effects

    Mar 5, 2026Ayed M. Alrashdi, Oussama Dhifallah, Houssem SifaouMulti--Task LearningDescent

  28. Accelerating Natural Gradient Descent for PINNs with Randomized Numerical Linear Algebra

    May 16, 2025Ivan Bioli, Carlo Marcati, Giancarlo SangalliSpectral PreconditioningNeural Solvers

  29. A Farewell to the Bias-Variance Tradeoff? An Overview of the Theory of Overparameterized Machine Learning

    Sep 6, 2021Yehuda Dar, Vidya Muthukumar, Richard G. BaraniukOverparameterizationBias-Variance Decomposition