Muon

Momentum

18 papers in the last four weeks, up 350% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 111

All topics
CardsList
  1. Does Muon Need Fine-Grained Spectral Shaping?

    Oct 5, 2026Meher Chaitanya, Tianyi Zhou, Aristides GionisMuonReweighting

  2. DGA-Muon: Decoupled Geometry-Aligned Adaptive Scaling for Muon

    Oct 5, 2026Wenpeng Zhang, Runsheng YuMuonSequential Scaling

  3. Muon Is Theoretically Wrong For Convolutions, But Empirically Effective

    Oct 5, 2026Thibaut Boissin, Thomas Massena, Mathieu Serrurier +1MuonNeural Network Optimization

  4. TACO: Ternary Absolute-max Column-wise One-sparse Optimizer for LLM Fine-Tuning

    Oct 1, 2026Jichao Jiang, Cristian McGee, El Houcine Bergou +2Model Fine-TuningLarge Language Model Fine-Tuning

  5. Muon meets Tamed Langevin: Momentum Preconditioning beyond Convex and gradient-Lipschitz Potentials

    Oct 1, 2026Nikolaos Makras, Sotirios SabanisLangevin DynamicsLipschitz Continuity

  6. AF-Muon: An AdamW-Free Muon Optimizer for Tied-Embedding Models

    Oct 1, 2026Arash Lagzian, Paniz Halvachi, Junming Zhang +2MuonAdam

  7. The Row Normalization Puzzle in Muon

    Sep 30, 2026Jiayu Zhang, Tianyi LinMuonNormalization

  8. Normalize-Then-Precondition: A Hierarchical Approach to Marginal Scale and Interaction Geometry for LLM Training

    Sep 29, 2026Zixuan Gong, Zeyu Gan, Jiaye Teng +1Spectral PreconditioningLarge Language Model Pretraining

  9. Second-Moment Stochastic Approximation Methods

    Sep 29, 2026Tao Jiang, Lin XiaoStochastic ApproximationAdaptive Optimizers

  10. MeqMuon: Matrix-Equilibrating Muon for LLM Pretraining

    Sep 28, 2026Chang-Wei Shi, Xu Wang, Wu-Jun LiLarge Language Model PretrainingMuon

  11. LionMuon: Alternating Spectral and Sign Descent for Efficient Training

    Sep 28, 2026Arman Bolatov, Artem Riabinin, Nikita Kornilov +4MuonDescent

  12. Muon Sublates the Edge of Stability in LLM Pretraining

    Sep 28, 2026Yanzhe Chen, Qifang Zhao, Xiaoxiao Xu +1MuonLarge Language Model Alignment

  13. NS-ATTENTION: Newton-Schulz Transformations of Attention Outputs in Vision Transformers

    Sep 23, 2026Xiaohe Jiang, Guoqiang Zhang, Tianjin Huang +1Transformer AttentionLinear Attention

  14. Muon Can Outperform Dedicated Continual Learning Methods

    Sep 21, 2026Sebastian George Sincari, Bogdan Alexandru Gheorghe, Antonio BarbalauReplay-Based Continual LearningContinual Learning

  15. Design of the IBM Granite 5.0 TurboCTC ASR Model

    Sep 17, 2026Brian Kingsbury, George Saon, Masayuki Suzuki +5End-To-End Automatic Speech Recognition ModelsMuon

  16. Derivative-Free Structured Updates for Muon

    Sep 15, 2026Pengcheng XieMuonDifferentiable Optimization

  17. Fast BIB simulation at a future Muon Collider with generative machine learning

    Sep 14, 2026Radha Mastandrea, Shiyu Peng, Benjamin Rosser +1MuonGenerative Models

  18. Muon-C: Operator-Aligned Muon for Convolutional Kernels

    Sep 9, 2026Jiaxin Qing, Lexin LiMuonDeep Unfolding Networks

  19. Equivariance Breaks the Learning Rate

    Sep 8, 2026Andrei Manolache, Mathias NiepertAdamEquivariant Neural Networks

  20. Beyond the Matrix Sign: Quadratic Spectral Descent

    Sep 7, 2026Qiaozhe Zhang, Jun Sun, Yingzhuang LiuMuonLocal Curvature

  21. Toward a First-Principles Update Geometry for the Language-Model Head

    Aug 23, 2026Aditya Somasundaram, Charles Guille-Escuret, Alexander Moreno +2Spectral NormMulti-Head Attention

  22. Federated Compositional Muon Optimizer for Matrix-Wise Models

    Aug 13, 2026Wang Yan, Feihu HuangMuonStochastic Optimization

  23. Dion3: Full-Stack Orthogonal Updates

    Aug 12, 2026Noah Amsel, Jack Zhang, Kwangjun Ahn +5MuonNewton

  24. Post-Grokking Collapse at the Representation-Readout Interface in Muon-Trained Transformers

    Aug 7, 2026Ali Janati, Kaoutar El Maghraoui, Anass BelfatmiMuonGrokking

  25. Muon on the Stiefel Manifold Admits an Exact Closed-Form Update

    Aug 6, 2026Mikhail Solonko, Molozhavenko Alexander, Maxim RakhubaMuonManifolds

  26. MALT: Lightweight Curvature-Aware Muon via Diagonal Preconditioning

    Aug 5, 2026Tongle Wu, Huanyu Dong, Ying Sun +1Spectral PreconditioningMuon

  27. Muon Meets Mamba: Spectral Optimization for State Space Models

    Aug 4, 2026Arslan Battalov, Karim Kramin, Alexander Markotenko +1MuonState Space Models

  28. Joint Affine Spectral Shaping: Coupling Weight and Bias Updates Beyond Weight-Only Muon

    Aug 4, 2026Gongyue Zhang, Honghai LiuAffineMuon

  29. CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization

    Aug 3, 2026Chuyan Chen, Peng Sun, Kun YuanDiffusion TransformersMuon

  30. Sharpness-Aware Minimization and Muon: Robustness under the Spectral Norm

    Jul 28, 2026Wenzhi Zhong, Edward Milsom, Michael MurraySharpness-Aware MinimizationRegularization

  31. Scale Weight Decay and Train Better

    Jul 26, 2026Anuj ApteWeight DecayBatch

  32. PoLoRA: A Preconditioned Orthogonalized LoRA Optimizer

    Jul 20, 2026Nikhil Ghosh, Tetiana Parshakova, Robert M. GowerMultimodal Continual Instruction TuningMuon

  33. When Does Muon Help Agentic Reinforcement Learning?

    Jul 17, 2026Kai Ruan, Jinghao Lin, Zihe Huang +4MuonAdam

  34. Muse: Representation Geometry of Muon Beyond Normalized Momentum

    Jul 16, 2026Da Chang, Qiankun Shi, Lvgang Zhang +4MuonRepresentation Space

  35. Mono-Z Dark Matter Search with Neural Spline Flows Using CMS Run 2015D Open Data

    Jul 15, 2026Hitesh Rasineni, Bhavishya ChebroluGeneral RelativityMuon

  36. Reassessing Muon for Matrix Factorization

    Jul 14, 2026Ali Parviz, Gal Mishne, Alex CloningerMuonAdam

  37. Efficient Long-Horizon Learning for Learned Optimization

    Jul 7, 2026Xiaolong Huang, Benjamin Thérien, James Harrison +1Meta-LearningAdaptive Optimizers

  38. Beyond Adam: SOAP and Muon for Faster, Label-Efficient Training of Machine Learning Interatomic Potentials

    Jul 2, 2026Gil Harari, Yoel Zimmermann, Ola Tangen Kulseng +4Interatomic PotentialsAdam

  39. Muon as a Residual Connection

    Jul 1, 2026Hao HuangMuonResidual Connections

  40. MNAR-kk-means: A kk-means Clustering for Data Missing Not at Random with Magnitude-Decaying Probability

    Jun 30, 2026Xin GuanK-MeansImputation

  41. Aurora: A Leverage-Aware Spectral Optimizer

    Jun 26, 2026Alec Dewulf, Dhruv Pai, Li Yang +2MuonBatch Normalization

  42. Hierarchical Muon: Tiled Newton-Schulz Updates for Efficient Muon Optimization

    Jun 25, 2026Ziyuan Tang, Tianshi Xu, Yousef Saad +1MuonNewton

  43. DMuon: Efficient Distributed Muon Training with Near-Adam Overhead

    Jun 25, 2026Vincent Chen, Starrick Liu, Regis Cheng +8MuonInference Workloads

  44. Tensorion: A Tensor-Aware Generalization of the Muon Optimizer

    Jun 24, 2026Vladimir Bogachev, Vladimir Aletov, Alexander Molozhavenko +2AdamMuon

  45. Muown Implicitly Performs Angular Step-size Decay

    Jun 22, 2026Florian Hübler, Kai Lion, Antonio Orvieto +1MuonAdaptive Optimizers

  46. Towards Understanding the Power and Limits of the Muon Optimizer: A River-Valley Perspective

    Jun 19, 2026Tianqi Shen, Jinji Yang, Runze Shi +3MuonAdam

  47. Fantastic Pretraining Optimizers and Where to Find Them II: Hyperball Optimization

    Jun 15, 2026Kaiyue Wen, Xingyu Dang, Kaifeng Lyu +2Adaptive OptimizersWeight Decay

  48. CacheMuon: Using Temporal Preconditioning To Approximate Polar Factor

    Jun 15, 2026Bishnu Dev, Sushil Bohara, Martin Takáč +1MuonSpectral Preconditioning

  49. Schattor: Schatten-family methods for deep learning optimization

    Jun 14, 2026Bohao Ma, Junyu Zhang, Chuan HeNeural Network OptimizationStochastic Optimization

  50. Free Heavy-Tailed Lunch for Muon: A Theoretical Justification of Empirical Success

    Jun 12, 2026Florian Hübler, Thomas Pethick, Suvrit SraSpectral NormMuon

  51. Muonp^p: Muon with Fractional Spectral Powers

    Jun 11, 2026Yihe Dong, Will SawinMuonSpectral

  52. LoRA-Muon: Spectral Steepest Descent on the Low-Rank Manifold

    Jun 11, 2026Franz Louis Cesista, Katherine Crowson, Cédric Simal +1Low-Rank StructureMuon

  53. Agentic Hybrid RAG for Evidence-Grounded Muon Collider Analysis

    Jun 9, 2026Ruobing Jiang, Dawei Fu, Cheng Jiang +6Agentic Retrieval-Augmented Generation SystemsMuon

  54. Muon Learns More Robust and Transferable Features than Adam

    Jun 8, 2026Tianyu Ruan, Fengzhuo Zhang, Shuche Wang +1AdamFeature Learning