Weight Decay

Momentum

7 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 6Week of Sep 21

Latest papers 46

All topics
CardsList
  1. Learning the identity: a case study of how SGD selects among functional decompositions

    Sep 30, 2026Andy Arditi, Weian Xie, David Bau +1Stochastic Gradient DescentAnisotropic Loss Landscapes

  2. The Life Cycle of a Massive Activation: Stochastic Birth, Weight-Decay-Driven Growth, and Competitive Consolidation

    Sep 30, 2026S. Aaron McClendon, Jorge Gallego-Feliciano, Antonios SaravanosWeight DecayAdam

  3. Imprint Reader: From Weight-Update Readout to Behavioral Intervention

    Sep 28, 2026Guanxu Chen, Qihao Lin, Jing ShaoLatent Feature InterventionsReadout

  4. Prediction with Expert Advice: Anytime Regret with Many Experts Matches the Fixed-Time Constant

    Sep 23, 2026Yang Cai, Vineet Gupta, Yanchen Jiang +4\Widetilde{\Mathcal{O}}(\Sqrt{T})$ RegretRegret

  5. A Spectral Theory of Grokking: Weight Decay induces Feature Learning

    Sep 22, 2026Lenz Pracher, Pascal de Jong, Oskar Lieshaus +2Neural Tangent KernelFeature Learning

  6. Double descent is the principle of least action

    Sep 16, 2026Congzhou M ShaDescentWeight Decay

  7. Symmetry without a manifold: intrinsic dimension on orbits

    Sep 15, 2026Chon-Fai Kam, Miloud Bessafi, Frédéric CadetIntrinsic DimensionalityScaling Laws

  8. A Theoretical Analysis of Generalization Dynamics in Neural Networks under Gradient Descent with Weight Decay

    Sep 7, 2026Yuqing Wang, Ioannis G. Kevrekidis, Mikhail BelkinTwo-Layer Neural NetworksGeneralization Bounds

  9. Distributed Optimization with Streaming Data: A Temporal Weighting Perspective

    Aug 10, 2026Muhammad Faraz Ul Abrar, Nicolò Michelusi, Erik G. LarssonDecentralized OptimizationWeight Decay

  10. Grokking on the Weight-Decay Clock: A Rate Hierarchy from Softly Broken Symmetries

    Jul 27, 2026Taeyoung KimGrokkingWeight Decay

  11. Scale Weight Decay and Train Better

    Jul 26, 2026Anuj ApteWeight DecayBatch

  12. Natural Invariant Measures for Chaotic Game Dynamics: Finding Order in Chaos

    Jul 23, 2026Jakub Bielawski, Thiparat Chotibut, Fryderyk Falniowski +2ChaosProbability Measures

  13. Weight-norm Criticality: A Mechanism for Loss Spikes Induced by the Normalization and Weight Decay

    Jul 23, 2026Xiaolong Li, Zhangchen Zhou, Zhi-Qin John XuWeight DecayAnisotropic Loss Landscapes

  14. Neural Collapse Is Forbidden: Information Floors in Language Models

    Jul 10, 2026Bruno AbrahaoNeural CollapseLanguage Modeling

  15. Disco-LoRA: Disentangled Composition of Content, Style, and Motion for Multi-concept Video Customization

    Jun 25, 2026Xuancheng Xu, Gengyun Jia, Bing-Kun BaoDuetMotion

  16. What Does the Weight Norm Control in Grokking? Logit-Scale Mediation under Cross-Entropy

    Jun 16, 2026Truong Xuan KhanhGrokkingWeight Decay

  17. Fantastic Pretraining Optimizers and Where to Find Them II: Hyperball Optimization

    Jun 15, 2026Kaiyue Wen, Xingyu Dang, Kaifeng Lyu +2Adaptive OptimizersWeight Decay

  18. The Weight Norm Sets the Grokking Timescale: A Causal Delay Law

    Jun 11, 2026Truong Xuan Khanh, Doan Hoang Viet, Luu Duc Trung +1GrokkingWeight Decay

  19. Last-Iterate Convergence of Optimistic Multiplicative Weight Update

    Jun 10, 2026Francesco OrabonaConvex OptimizationPrimal-Dual Methods

  20. Fixed-Parameter Tractability of Private Synthetic Data Generation

    Jun 9, 2026Badih Ghazi, Cristóbal Guzmán, Pritish Kamath +3Synthetic DataDistributional Fidelity

  21. Deciphering Two Training Clocks in Grokking via Deep Linear Network Theory with Conditional ReLU Reduction

    Jun 4, 2026Hu Tan, Kuo Gai, Shihua ZhangDeep NetworkRectified Linear Unit

  22. Overcoming Forgetting in LLM Fine-Tuning with Evolution Strategies

    May 28, 2026Kajetan Schweighofer, Conor F. Hayes, Roberto Dailey +2Large Language Model Fine-TuningCatastrophic Forgetting

  23. Theoretical Analysis of Sparse Optimization with Reparameterization, Weight Decay, and Adaptive Learning Rate

    May 24, 2026Huangyu Xu, Jingqin Yang, Qianqian Xu +1SparsityRegularization

  24. Does Weight Decay Enhance Training Stability?

    May 15, 2026Marius Saether, Amir Kolic, Tomaso Poggio +1Weight DecayPhase Transitions

  25. When and Why is Optimistic Multiplicative Weights Slow? The Geometry of Energy Dissipation

    May 13, 2026John Lazarsfeld, Anas Barakat, Georgios Piliouras +2Imperfect-Information GamesConvergence

  26. OUI as a Structural Observable: Towards an Activation-Centric View of Neural Network Training

    May 12, 2026Alberto Fernández-Hernández, Jose I. Mestre, Cristian Pérez-Corral +3Deep NetworkNeural Network

  27. OUIDecay: Adaptive Layer-wise Weight Decay for CNNs Using Online Activation Patterns

    May 11, 2026Alberto Fernández-Hernández, Jose I. Mestre, Cristian Pérez-Corral +3Weight DecayConvolutional Neural Networks

  28. Decentralized Time-Varying Optimization for Streaming Data via Temporal Weighting

    May 7, 2026Muhammad Faraz Ul Abrar, Nicolò Michelusi, Erik G. LarssonDecentralized OptimizationWeight Decay

  29. TsallisPGD: Adaptive Gradient Weighting for Adversarial Attacks on Semantic Segmentation

    May 5, 2026Alexander Matyasko, Xin Lou, Indriyati Atmosukarto +1Efficient Semantic SegmentationSemantic Segmentation

  30. Prescriptive Scaling Laws for Data Constrained Training

    May 2, 2026Justin Lovelace, Christian Belardi, Srivatsa Kundurthy +2Scaling LawsWeight Decay

  31. Learning to Forget: Continual Learning with Adaptive Weight Decay

    Apr 29, 2026Aditya A. Ramesh, Alex Lewandowski, Jürgen SchmidhuberWeight DecayContinual Learning

  32. Neural Network Optimization Reimagined: Decoupled Techniques for Scratch and Fine-Tuning

    Apr 21, 2026Xin Ning, Qiankun Li, Xiaolong Huang +5Neural Network OptimizationParameter-Efficient Fine-Tuning Methods

  33. Uniform Approximation of Functions with Asymmetric Growth and Decay by Deep Weighted Polynomials

    Jun 26, 2025Kingsley Yeon, Steven B. DamelinApproximationMathematical Finance

  34. Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization

    May 28, 2025Etienne Boursier, Matthew Bowditch, Matthias Englert +1Anisotropic Loss LandscapesOverparameterization

  35. Stability and Convergence of Optimistic Exponential Weights with Asymmetric Step Sizes in Bimatrix Games

    Date pendingHédi Hadiji, Sarah SachsImperfect-Information GamesEquilibrium