Adam

Momentum

17 papers in the last four weeks, up 467% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 100

All topics
CardsList
  1. Early Memory Selection for Balanced Adam

    Oct 6, 2026Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre +2AdamParameter-Efficient Adaptation

  2. AF-Muon: An AdamW-Free Muon Optimizer for Tied-Embedding Models

    Oct 1, 2026Arash Lagzian, Paniz Halvachi, Junming Zhang +2MuonAdam

  3. The Life Cycle of a Massive Activation: Stochastic Birth, Weight-Decay-Driven Growth, and Competitive Consolidation

    Sep 30, 2026S. Aaron McClendon, Jorge Gallego-Feliciano, Antonios SaravanosWeight DecayAdam

  4. What Pretraining and Midtraining Make Learnable from Rewards?

    Sep 29, 2026Chiwun Yang, Xiaoyu LiReinforcement Learning Post-TrainingPretraining

  5. Adam under Generalized Smoothness with Second-Moment-Type Stochastic Gradients

    Sep 29, 2026Ruinan Jin, Difei Cheng, Ling Chen +3SmoothnessAdam

  6. EvE: An Alternate Optimizer to Adam

    Sep 28, 2026Shashank Raj, Kalyanmoy DebAdamEvolutionary Optimization Methods

  7. The Hidden Ratio in Adam: Stable Structure, Compression, and Sign Dynamics

    Sep 28, 2026Yihe Zhou, Tongtian Zhu, Yingxiao Huo +4AdamMomentum Stochastic Gradient Descent

  8. On the Two Faces of Adam in Separable Linear Classification

    Sep 27, 2026Chen Fan, Csaba SzepesváriAdamGradient Descent

  9. Low-Rank Friction for Memory-Efficient Transformer Pretraining

    Sep 24, 2026Rajit Rajpal, Benedict LeimkuhlerAdamTransformer Architectures

  10. Continuous Optimization for p-adic Models

    Sep 21, 2026Julian Salazar, Dimitri Kanevsky, Matt Harvey +2Adam

  11. Online Supervised Dimension Reduction with Random Features: Diagnostics and Computational Trade-offs

    Sep 17, 2026Zhenlin Yao, Wei XiongPrincipal Component AnalysisSubspace

  12. Directions That Don't Drift: Stiefel Manifold Routing for Transformer Attention

    Sep 16, 2026Rubén Darío GuerreroRiemannian OptimizationAdam

  13. Beyond Quadratic Loss: The Stability Phase Diagram of Adam

    Sep 16, 2026Gaoxiang Tang, Huanran Chen, Ziming LiuAdamAnisotropic Loss Landscapes

  14. A Full Adam Theorem for Spectral Heavy-Tail Onset

    Sep 14, 2026Zongmin LiuAdam

  15. AdamX: Cosine similarity meets gradient descent

    Sep 10, 2026Francisco Caldas, Ruben Belo, Cláudia SoaresAdamGradient Descent

  16. SkillAdam: Stable and Efficient Skill Evolution for Agents

    Sep 8, 2026Gaoyuan Li, Meihao Fan, Yizhe Liu +7Skill EvolutionSkills

  17. Equivariance Breaks the Learning Rate

    Sep 8, 2026Andrei Manolache, Mathias NiepertAdamEquivariant Neural Networks

  18. Adam at the Edge of Stability: Adaptive Feedback, Provable Oscillation, and Gradient Reversal

    Aug 21, 2026Yiman Fong, Heng YangAdamLocal Curvature

  19. The Loss Does Not See the Basis, but Adam Does

    Aug 5, 2026Devender SinghLow-Rank StructureAdam

  20. MESH: Memory-Efficient Sinkhorn Optimization for Mixture-of-Experts Training

    Aug 5, 2026Masato FujitakeMixture-Of-ExpertsAdam

  21. Joint Affine Spectral Shaping: Coupling Weight and Bias Updates Beyond Weight-Only Muon

    Aug 4, 2026Gongyue Zhang, Honghai LiuAffineMuon

  22. The Convergence Behavior of Adam under Heavy-Tailed Noise

    Jul 29, 2026Yijiang PangAdamStochastic Convex Optimization

  23. Reconstructing Backpropagation from Forward Fluctuations in Noise-modulated Neural Networks

    Jul 29, 2026Shuhei IkemotoBackpropagationNeural Network

  24. PYPM-GGD: Pitman-Yor Process Mixture with Generalized Gaussian Density using ADAM

    Jul 27, 2026Kart-Leong LimVariational InferenceAdam

  25. Backpropagation-Free Trunk Training via the Split Forward Gradients

    Jul 18, 2026Tian Qin, Wei-Min HuangBackpropagationGradient

  26. When Does Muon Help Agentic Reinforcement Learning?

    Jul 17, 2026Kai Ruan, Jinghao Lin, Zihe Huang +4MuonAdam

  27. Reassessing Muon for Matrix Factorization

    Jul 14, 2026Ali Parviz, Gal Mishne, Alex CloningerMuonAdam

  28. M+Adam: Low-Precision Training via Additive-Multiplicative Optimization

    Jul 12, 2026Xiaoyuan Liang, Sebastian Loeschcke, Mads Toftrup +1Mixed-Precision QuantizationAdam

  29. Unified convergence analysis for gradient descent optimization methods in the training of deep neural networks

    Jul 5, 2026Shokhrukh Ibragimov, Arnulf JentzenNeural Network OptimizationGradient Descent

  30. Directional Curvature from Armijo Backtracking: A Low-Cost Sharpness Probe and a Calibration-Free Learning-Rate Safeguard for Adam

    Jul 4, 2026Ashmitha R, Jörg FrochteAdamSharpness-Aware Minimization

  31. On the Convergence of Adam, Revisited

    Jul 3, 2026Steven Heilman, Sampad MohantyAdam\Widetilde{\Mathcal{O}}(\Sqrt{T})$ Regret

  32. Beyond Adam: SOAP and Muon for Faster, Label-Efficient Training of Machine Learning Interatomic Potentials

    Jul 2, 2026Gil Harari, Yoel Zimmermann, Ola Tangen Kulseng +4Interatomic PotentialsAdam

  33. Analysis of Adam Algorithms for Stochastic Dynamic Systems

    Jun 27, 2026Xin Zheng, Yifei Jin, Lei GuoAdamStochastic Dynamics

  34. Tensorion: A Tensor-Aware Generalization of the Muon Optimizer

    Jun 24, 2026Vladimir Bogachev, Vladimir Aletov, Alexander Molozhavenko +2AdamMuon

  35. Open Problem: Is AdamW Effective Under Heavy-Tailed Noise?

    Jun 22, 2026Dingzhi Yu, Hongyi Tao, Yuanyu Wan +2AdamLong-Tailed Distribution

  36. Adam Converges in Nonsmooth Nonconvex Optimization

    Jun 21, 2026Zijian LiuStochastic Convex OptimizationAdam

  37. Towards Understanding the Power and Limits of the Muon Optimizer: A River-Valley Perspective

    Jun 19, 2026Tianqi Shen, Jinji Yang, Runze Shi +3MuonAdam

  38. Central limit theorem for the averaged Adam optimizer

    Jun 19, 2026Steffen Dereich, Arnulf JentzenStochastic ApproximationLarge Deviation Principle

  39. Towards Robust Training in NNGPT AutoML Pipeline: A Loss-Optimizer Pairing Selection Study

    Jun 18, 2026Anton Abramochkin, Radu Timofte, Dmitry IgnatovNeural Architecture SearchAdam

  40. Beyond a Single Explanation of the Adam--SGD Gap

    Jun 12, 2026Chenxiang Zhang, Rustem Islamov, Enea Monzio Compagnoni +3AdamExplainable AI Methods

  41. Preserving Plasticity in Continual Learning via Dynamical Isometry

    Jun 8, 2026Andries Rosseau, Robert Müller, Ann NowéPlasticityContinual Learning

  42. Muon Learns More Robust and Transferable Features than Adam

    Jun 8, 2026Tianyu Ruan, Fengzhuo Zhang, Shuche Wang +1AdamFeature Learning

  43. On solving symmetric multi-type orthogonal non-negative matrix tri-factorization problem

    Jun 6, 2026Rok Hribar, Gregor Papa, Janez Povh +1OrthogonalityAdam

  44. Why Muon Outperforms Adam: A Curvature Perspective

    Jun 3, 2026Shuche Wang, Fengzhuo Zhang, Jiaxiang Li +2AdamMuon

  45. Beyond Gradient Descent: Adam for Analog Ising Machines

    Jun 2, 2026Stijn Van Vooren, Guy Van der Sande, Guy VerschaffeltSpatial Photonic Ising MachinesAdam

  46. MAdam: Metric-Aware Multi-Objective Adam

    Jun 2, 2026Fengbei Liu, Rachit Saluja, Sunwoo Kwak +5AdamMulti-Objective Optimization

  47. DECA: Decentralizing Block-Wise Adam for Efficient LLM Full-Parameter Fine-Tuning on Non-IID Data

    Jun 2, 2026Yunsheng Yuan, Shaowei Li, Kai Wang +5Parameter-Efficient Fine-Tuning MethodsLarge Language Model Fine-Tuning

  48. Memory-Efficient LLM Training with Dynamic Sparsity: From Stability to Practical Scaling

    May 30, 2026Qiao Xiao, Boqian Wu, Patrik Okanovic +6Large Language Model TrainingSparsity

  49. Convergence of Steepest Descent and Adam under Non-Uniform Smoothness

    May 28, 2026Sharan Vaswani, Yifan Sun, Reza BabanezhadGradient DescentSmoothness