Optimizer Design

Latest papers 24

All topics
CardsList
  1. AutoLoCo: Communication Efficient Distributed LLM Training via Adaptive Synchronization

    Sep 29, 2026Pengyu He, Yan Zhang, Ruien Li +1Large Language Model TrainingBatch

  2. Muon-C: Operator-Aligned Muon for Convolutional Kernels

    Sep 9, 2026Jiaxin Qing, Lexin LiMuonDeep Unfolding Networks

  3. LazyTrain: Limited-resource Allocation toward Zero-waste Yield Optimization in Large Language Model Training

    Aug 12, 2026Xiaojun Wu, Cehao Yang, Honghao Liu +5Large Language Model TrainingGraphics Processing Unit Memory

  4. Muon Meets Mamba: Spectral Optimization for State Space Models

    Aug 4, 2026Arslan Battalov, Karim Kramin, Alexander Markotenko +1MuonState Space Models

  5. Draining the Energy Commons: Self-Defeating Over-Appropriation as a Coordination Failure in Agentic LLM Collectives

    Jul 24, 2026Marcantonio Bracale Syrnicov, Federico Pierucci, Matteo Prandi +4Optimizer Design

  6. Sampling on Random Subspaces under Limited Data in the Context of Exploratory Landscape Analysis

    Jul 8, 2026Iván Olarte Rodríguez, Anja Jankovic, Thomas Bäck +1Optimization LandscapeOptimal Design

  7. The Anatomy of Implicit Bias: Information Allocation in Neural Network Training

    Jul 8, 2026Zhang Gongyue, Wang Zhiyong, Liu Donghan +3Neural Network OptimizationOptimizer Design

  8. Bridging Spherical Black-Box Optimizers

    Jun 24, 2026Johannes Ackermann, Stefano PeluchettiBlack-Box OptimizationOptimizer Design

  9. FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training

    Jun 22, 2026Dikshant Kukreja, Kritarth Prasad, Avinash Anand +6Matched Fp16 IntermediateOptimizer Design

  10. MSC-CMA-ES: Structure-Aware Restarts for CMA-ES via Cyclic Nearest-Better Basin Discovery

    Jun 14, 2026Dimitar Nedanovski, Svetoslav Nenov, Dimitar PilevMetaheuristicsBasin

  11. Structure from Reasoning, Numbers from Search: On-Premise Open LLMs as Structural Priors for Coupled MIMO Controller Tuning

    Jun 9, 2026Jiaxuan Chen, Haonan Li, Yang ShuTuningRobust Control

  12. On the Optimizer Dependence of Neural Scaling Laws

    May 28, 2026Vansh Ramani, Shourya Vir JainScaling LawsOptimizer Design

  13. From SGD to Muon: Adaptive Optimization via Schatten-p Norms

    May 19, 2026Thomas Massena, Corentin Friedrich, Mathieu SerrurierOptimizer DesignMuon

  14. Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers

    May 18, 2026Tim Tsz-Kit Lau, Weijie SuAdaptive OptimizersOptimizer Design

  15. Context Training with Active Information Seeking

    May 13, 2026Zeyu Huang, Adhiguna Kuncoro, Qixuan Feng +4Optimizer DesignPhysical Activities

  16. Muown: Row-Norm Control for Muon Optimization

    May 11, 2026Kai Lion, Florian Hübler, Bingcong Li +2MuonOptimizer Design

  17. Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers

    May 9, 2026Aditya RanganathOptimizer DesignLarge Language Model Training

  18. Budget-aware Auto Optimizer Configurator

    May 6, 2026Kang Liu, Wei Peng, Jianchen HuOptimizer DesignGraphics Processing Unit Memory

  19. FIBER: A Differentially Private Optimizer with Filter-Aware Innovation Bias Correction

    May 5, 2026Duc Dm, Thao Do, Minh Son Hoang +3Optimizer DesignPrivacy-Utility Trade-Offs

  20. Benchmarking Optimizers for MLPs in Tabular Deep Learning

    Apr 16, 2026Yury Gorishniy, Ivan Rubachev, Dmitrii Feoktistov +1Tabular LearningOptimizer Design

  21. Prism: Symbolic Superoptimization of Tensor Programs

    Apr 16, 2026Mengdi Wu, Xiaoyu Jiang, Oded Padon +1Optimizer DesignTensor Networks

  22. To Use or not to Use Muon: How Simplicity Bias in Optimizers Matters

    Feb 28, 2026Sara Dragutinović, Yedi Zhang, Rajesh RanganathMuonAdam

  23. On the Gradient Complexity of Private Optimization with Private Oracles

    Nov 17, 2025Michael Menart, Aleksandar NikolovFirst Order Oracle ComplexityConvex Loss