Deep Learning Optimization

Latest papers 128

All topics
CardsList
  1. DeltaTTT: Layerwise Optimization for Nonlinear Recurrent Memory

    Oct 6, 2026Yining Li, Dongchen Han, Jie Fu +1Deep Learning OptimizationNeural Network Optimization

  2. How Bregman Divergences Shape Shampoo

    Oct 6, 2026Bing Liu, Wenjie Zhou, Chengcheng Zhao +4Deep Learning OptimizationFunctional Bregman Divergences

  3. Does Muon Need Fine-Grained Spectral Shaping?

    Oct 5, 2026Meher Chaitanya, Tianyi Zhou, Aristides GionisDeep Learning OptimizationMuon Optimizer

  4. Learning Pareto Stationary Fronts via Single-Pass Backpropagation

    Oct 5, 2026Elina Rojin Celik, Marcos Medeiros Raimundo, Isabel ValeraDeep Learning OptimizationMulti-Objective Optimization

  5. Mind the Drift: Diagonal Linear Networks Under Large Learning Rates

    Oct 5, 2026Aniket Sanyal, Tom Jacobs, Rebekka BurkholzEdge of StabilityDeep Learning Optimization

  6. ORCA: The Annealed Spectral Conditioning Optimizer for Faster, Better LLM Training

    Oct 5, 2026Yuanshi Liu, Boyuan Jiang, Liang Hou +4Spectral RegularizationDeep Learning Optimization

  7. SoftServe: A Scalable Quasi-Newton Method for Deep Learning

    Oct 1, 2026Joohwan Ko, Tetiana Parshakova, Diana Cai +1Deep Learning OptimizationSecond-Order Optimization

  8. Increasing Width Allows Greedy Layer-wise Training to Rival End-to-End Backpropagation in Self-Supervised Learning

    Sep 30, 2026Syon Mansur, Joel ZylberbergDeep Learning OptimizationConvolutional Neural Networks

  9. From Spectra to Joint Schedules in LLM Pre-training: 3+3(+2) Scaling-Law Regimes

    Sep 30, 2026Yichen Wang, Fanghui Liu, Yudong ChenLanguage Model PretrainingDeep Learning Optimization

  10. EvE: An Alternate Optimizer to Adam

    Sep 28, 2026Shashank Raj, Kalyanmoy DebDeep Learning OptimizationDifferential Evolution

  11. Low-Rank Friction for Memory-Efficient Transformer Pretraining

    Sep 24, 2026Rajit Rajpal, Benedict LeimkuhlerDeep Learning OptimizationLow-Rank Compression

  12. AdamX: Cosine similarity meets gradient descent

    Sep 10, 2026Francisco Caldas, Ruben Belo, Cláudia SoaresDeep Learning OptimizationAdaptive Gradient Methods

  13. BrachistoneLR: A Brachistochrone-Inspired Learning-Rate Schedule and a Controlled Benchmark of Scheduling Policies

    Sep 8, 2026Md. Sadekur Rahman Roni, Md. Jalal uddin Chowdhury, Moutusi Dash NimiDeep Learning OptimizationLearning Rate Scheduling

  14. Activation-Keyed Momentum: An Anisotropic Momentum Update via the Delta Rule

    Aug 19, 2026Euijin Hong, Guannan QuDeep Learning OptimizationMomentum Methods

  15. Momentum as Residual-Driven Multiplier Correction for Deep Learning Optimization

    Aug 13, 2026Zhixin Ren, Yau Lyu, Congrong Li +2Deep Learning OptimizationMomentum Methods

  16. Towards joint scaling laws with optimal batch size schedules

    Jul 30, 2026Jiaxiang Li, Zhiqi Bu, Shiyun XuDeep Learning OptimizationLanguage Model Scaling Laws

  17. Learning Faster without Deeper Networks: A*-Inspired Batch Selection for Efficient CNN Training

    Jul 17, 2026Anxhelo Shehu, Enes Stastoli, Arben CelaDeep Learning OptimizationConvolutional Neural Networks

  18. Reassessing Muon for Matrix Factorization

    Jul 14, 2026Ali Parviz, Gal Mishne, Alex CloningerDeep Learning OptimizationMuon Optimizer

  19. LionVote: Per-Layer Learning Rate Adaptation for Lion

    Jul 10, 2026Kris AtallahDeep Learning OptimizationLayer-Wise Learning Rate Adaptation

  20. Beyond Backpropagation: Monte Carlo Method Can Train Deep Neural Networks

    Jul 9, 2026Hong ZhaoDeep Learning Optimization

  21. Unified convergence analysis for gradient descent optimization methods in the training of deep neural networks

    Jul 5, 2026Shokhrukh Ibragimov, Arnulf JentzenDeep Learning OptimizationNeural Network Optimization

  22. OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers

    Jul 4, 2026Siyuan Li, Jiabao Pan, Yumou Liu +9Deep Learning OptimizationNeural Network Optimization

  23. Class-Grouped Normalized Momentum and Faster Hyperparameter Exploration to Tackle Class Imbalance in Federated Learning

    Jul 1, 2026Haemin Park, Diego Klabjan, Martin W. Braun +2Class-Imbalanced LearningDeep Learning Optimization

  24. Gradient Smoothing: Coupling Layer-wise Updates for Improved Optimization

    Jun 29, 2026Haoming Meng, Anton Sugolov, Vardan PapyanDeep Learning OptimizationNeural Network Optimization

  25. Tensorion: A Tensor-Aware Generalization of the Muon Optimizer

    Jun 24, 2026Vladimir Bogachev, Vladimir Aletov, Alexander Molozhavenko +2Deep Learning OptimizationMuon Optimizer

  26. An Analysis of Posterior Collapse, Parameterization and Initialization in Variational Deep Gaussian Processes

    Jun 24, 2026Francisco Javier Sáez-Maldonado, Juan Maroñas, Daniel Hernández-LobatoDeep Learning OptimizationPosterior Collapse

  27. Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models

    Jun 23, 2026Kwok Chun Au, Adam BlockDeep Learning OptimizationLLM Training

  28. Fast and Slow Variational Continual Learning

    Jun 22, 2026Subarnaduti Paul, Yohan Jung, Mohammad Emtiyaz Khan +3Continual Learning for LLMsDeep Learning Optimization

  29. Towards Understanding the Power and Limits of the Muon Optimizer: A River-Valley Perspective

    Jun 19, 2026Tianqi Shen, Jinji Yang, Runze Shi +3Deep Learning OptimizationMuon Optimizer

  30. Breaking chains with trees: Deep learning with O(log⁡N)\mathcal{O}(\log N) parallel time complexity

    Jun 19, 2026Neeraj Mohan Sushma, Aditya Nagarsekar, Cabrel Teguemne Fokam +4Deep Learning OptimizationNeural Network Optimization

  31. Towards Robust Training in NNGPT AutoML Pipeline: A Loss-Optimizer Pairing Selection Study

    Jun 18, 2026Anton Abramochkin, Radu Timofte, Dmitry IgnatovDeep Learning OptimizationNeural Network Optimization

  32. eCNNTO: A Highly Generalizable ConvNet for Accelerating Topology Optimization

    Jun 18, 2026Shengbiao Lu, Xiaodong WeiTopology OptimizationDeep Learning Optimization

  33. Schattor: Schatten-family methods for deep learning optimization

    Jun 14, 2026Bohao Ma, Junyu Zhang, Chuan HeDeep Learning OptimizationStochastic Optimization Convergence

  34. Beyond a Single Explanation of the Adam--SGD Gap

    Jun 12, 2026Chenxiang Zhang, Rustem Islamov, Enea Monzio Compagnoni +3Deep Learning OptimizationAdaptive Gradient Methods

  35. Gefen: Optimized Stochastic Optimizer

    Jun 11, 2026Nadav Benedek, Tomer Koren, Ohad FriedDeep Learning OptimizationMemory-Efficient Optimization

  36. LoRA-Muon: Spectral Steepest Descent on the Low-Rank Manifold

    Jun 11, 2026Franz Louis Cesista, Katherine Crowson, Cédric Simal +1Deep Learning OptimizationRiemannian Optimization

  37. 5% > 100%: Flatness Preference is All You Need for Multimodal Parameter-Efficient Fine-Tuning

    Jun 9, 2026Yifan Zhu, Can Lin, Hangjie Yuan +4Deep Learning OptimizationFlat Minima

  38. FOGO: Forgetting-aware Orthogonalization Optimizer

    Jun 9, 2026Toan Nguyen, Yang Liu, Trung Le +2Deep Learning OptimizationContinual Learning

  39. Principles and Practice of Deep Representation Learning: or a Mathematical Theory of Memory

    Jun 4, 2026Sam Buchanan, Druv Pai, Peng Wang +1Deep Learning OptimizationRepresentation Learning

  40. Double Preconditioning (DoPr): Optimization for Test-Time Performance, not Validation Loss

    Jun 4, 2026Thomas T. Zhang, Alok Shah, Yifei Zhang +3Deep Learning Optimization

  41. Denoise First, Orthogonalize Later: Understanding Momentum in Muon via Spectral Filtering

    Jun 2, 2026Xianliang Li, Zihan Zhang, Weiyang Liu +1Deep Learning OptimizationMomentum Methods

  42. Balancing Learning Rates Across Layers: Exact Two-Step Dynamics and Optimal Scaling in Linear Neural Networks

    May 29, 2026Tianyu Pang, Vignesh Kothapalli, Shenyang Deng +3Deep Learning OptimizationNeural Network Training Dynamics

  43. Softsign: Smooth Sign in Your Optimizer For Better Parameter Heterogeneity Handling

    May 29, 2026Dmitrii Feoktistov, Timofey Belinsky, Andrey Veprikov +2Stochastic OptimizationSign-Based Optimization

  44. Inconsistency-Aware Minimization: Improving Generalization with Unlabeled Data

    May 29, 2026Hee-Sung Kim, Hyeonseong Kim, Sungyoon LeeNeural Network GeneralizationDeep Learning Optimization

  45. The Stability of Singular Distribution: A Spectral Perspective on the Two-Phase Dynamics of Language Model Pre-training

    May 26, 2026Hongtao Zhang, Wenjie Zhou, Chenxi Jia +2Language Model PretrainingDeep Learning Optimization

  46. Reparametrizing Shampoo and SOAP for Subspace Basis Updates and BFloat16 Storage

    May 25, 2026Alan Milligan, Zikun Xu, Simon Lacoste-Julien +2Deep Learning OptimizationMemory-Efficient Optimization

  47. BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training

    May 25, 2026Zili Zhang, Chengxu Yang, Shenglong Zhang +8Deep Learning OptimizationMultimodal Large Language Models

  48. EMA-Nesterov: Stabilizing Nesterov's Lookahead for Accelerated Deep Learning Optimization

    May 25, 2026Chung-Yiu Yau, Dawei Li, Athanasios Glentis +3Deep Learning OptimizationGradient Descent