Deep Learning Optimization

Latest papers 132

All topics
CardsList
  1. Fix the Loss, Not the Radius: Rethinking the Adversarial Perturbation of Sharpness-Aware Minimization

    May 11, 2026Jinping Wang, Qinhan Liu, Zhiwu Xie +1Neural Network GeneralizationSharpness-Aware Minimization

  2. OUIDecay: Adaptive Layer-wise Weight Decay for CNNs Using Online Activation Patterns

    May 11, 2026Alberto Fernández-Hernández, Jose I. Mestre, Cristian Pérez-Corral +3Deep Learning OptimizationWeight Decay

  3. Refresh-Scaling the Memory of Balanced Adam

    May 11, 2026Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre +2Deep Learning OptimizationMomentum Methods

  4. LBI: Parallel Scan Backpropagation via Latent Bounded Interfaces

    May 9, 2026Shaun Christopher Lee, Sangeetha Abdu JyothiDeep Learning OptimizationBackpropagation

  5. Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers

    May 9, 2026Aditya RanganathDeep Learning OptimizationMemory-Efficient Optimization

  6. Predicting Plasticity in Deep Continual Learning: A Theoretical Perspective

    May 9, 2026Jiuqi Wang, Jayanth Srinivasa, Claire Chen +3Deep Learning OptimizationLoss of Plasticity

  7. Muon Does Not Converge on Convex Lipschitz Functions

    May 9, 2026Tetiana Parshakova, Ahmed Khaled, Michael Crawshaw +2Deep Learning OptimizationMuon Optimizer

  8. Directional Consistency as a Complementary Optimization Signal: The GONO Framework

    May 7, 2026Victor Daniel GeraDeep Learning OptimizationStochastic Optimization Convergence

  9. Pro-KLShampoo: Projected KL-Shampoo with Whitening Recovered by Orthogonalization

    May 7, 2026Ruotong Sun, Ermin WeiLanguage Model PretrainingDeep Learning Optimization

  10. Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio

    May 7, 2026Ziqing Wen, Zhouyang Liu, Jiahuan Wang +4Deep Learning OptimizationLearning Rate Scheduling

  11. Budget-aware Auto Optimizer Configurator

    May 6, 2026Kang Liu, Wei Peng, Jianchen HuDeep Learning OptimizationMemory-Efficient Optimization

  12. Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization

    May 6, 2026Zheng Fang, Xiaosen Wang, Shenyi Zhang +2Deep Learning OptimizationAudio-Language Models

  13. Layerwise LQR for Geometry-Aware Optimization of Deep Networks

    May 5, 2026Simon Dufort-Labbé, Pierre-Luc Bacon, Razvan Pascanu +2Deep Learning OptimizationSecond-Order Optimization

  14. Trust, but Verify: Peeling Low-Bit Transformer Networks for Training Monitoring

    May 4, 2026Arian Eamaz, Farhang Yeganegi, Mojtaba SoltanalianDeep Learning OptimizationNeural Network Training Dynamics

  15. Artificial Jagged Intelligence as Uneven Optimization Energy Allocation Capability Concentration, Redistribution, and Optimization Governance

    May 2, 2026Wesley Shu, Peng WeiDeep Learning Optimization

  16. Learning Rate Engineering: From Coarse Single Parameter to Layered Evolution

    Apr 30, 2026Ming-Hong Yao, Di Wang, Jian Cui +5Deep Learning OptimizationFine-Tuning

  17. Learning to Forget: Continual Learning with Adaptive Weight Decay

    Apr 29, 2026Aditya A. Ramesh, Alex Lewandowski, Jürgen SchmidhuberDeep Learning OptimizationWeight Decay

  18. Learn&Drop: Fast Learning of CNNs based on Layer Dropping

    Apr 25, 2026Giorgio Cruciata, Luca Cruciata, Liliana Lo Presti +2Deep Learning OptimizationConvolutional Neural Networks

  19. A Layer Separation Optimization Framework for Cross-Entropy Training in Deep Learning

    Apr 25, 2026Yaru Liu, Michael K. Ng, Yiqi GuDeep Learning OptimizationNonconvex Optimization

  20. Training Time Prediction for Mixed Precision-based Distributed Training

    Apr 17, 2026Minchul Kang, Changyong Shin, Jinwoo Jeong +5Deep Learning OptimizationDistributed Training

  21. Natural gradient descent with momentum

    Apr 16, 2026Anthony Nouy, Agustín SomacalDeep Learning OptimizationRiemannian Optimization

  22. Benchmarking Optimizers for MLPs in Tabular Deep Learning

    Apr 16, 2026Yury Gorishniy, Ivan Rubachev, Dmitrii Feoktistov +1Multilayer PerceptronsDeep Learning Optimization

  23. CLion: Efficient Cautious Lion Optimizer with Enhanced Generalization

    Apr 16, 2026Feihu Huang, Guanyi Zhang, Songcan ChenStochastic OptimizationSign-Based Optimization

  24. VISTA: Validation-Informed Trajectory Adaptation via Self-Distillation

    Apr 13, 2026Eli Corn, Daphna WeinshallNeural Network GeneralizationDeep Learning Optimization

  25. Sven: Singular Value Descent as a Computationally Efficient Natural Gradient Method

    Apr 1, 2026Samuel Bright-Thonney, Thomas R. Harvey, Andre Lukas +1Deep Learning OptimizationNatural Gradient Methods

  26. SPARKLING: Balancing Signal Preservation and Symmetry Breaking for Width-Progressive Learning

    Feb 2, 2026Qifan Yu, Xinyu Ma, Zhijian Zhuo +7Deep Learning Optimization