Hyperparameter

Momentum

3 papers in the last four weeks, down 25% on the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 50

All topics
CardsList
  1. How to scale your HEP ML models: A recipe for robust architecture comparisons at scale

    Oct 5, 2026Matthias Vigl, Nikita Pond, Jackson Barr +5Model SizeHyperparameter

  2. On Hyperparameter Tuning on the Test Set

    Oct 5, 2026Matteo Fregonara, Tom Viering, Jan van GemertHyperparameter

  3. How Does Local Landscape Geometry Evolve in Language Model Pre-Training?

    Sep 30, 2026Zhanpeng Zhou, Yuhan Sun, Bingrui Li +4Large Language Model PretrainingBatch

  4. Hyperparameter Scaling Laws Across MoE Sparsity

    Sep 8, 2026Changxin Tian, Kunlong Chen, Jia Liu +3HyperparameterMixture-Of-Experts Architectures

  5. TeMo: Temperature Modulation for Multimodal Contrastive Learning

    Sep 7, 2026Dhimitrios Duka, Bernt Schiele, Hilde Kuehne +1Multimodal Contrastive LearningContrastive Learning

  6. Efficiently Estimating Optimal Hyperparameter Scaling Laws through Power-Law Entropy Search

    Sep 1, 2026Zhiliang Chen, Sebastian Ament, David Eriksson +4HyperparameterLarge Language Model Training

  7. Small-Scale Experiments: Are We There Yet?

    Aug 12, 2026Nicholas Lourie, Kyunghyun Cho, Karen Ullrich +1Scaling LawsModel Size

  8. Dynamics Models for Offline Hyperparameter Selection in Real-World RL

    Aug 11, 2026Jordan Coblin, Han Wang, Martha White +1Model-Based Reinforcement LearningHyperparameter

  9. Predicting Deep Neural Network Training Outcomes from Early Training Telemetry

    Aug 4, 2026Ranjita Naik, Anh D. Nguyen, Pankaj Kumar SinghNeural Network TrainingEpoch

  10. Towards Practical Algorithm Selection for Unsupervised Domain Adaptation in Medical Imaging

    Jul 30, 2026Yiheng Xiong, Luisa Gallée, Daniel Santak Wolf +2Domain AdaptationMedical Imaging Datasets

  11. Efficient Heteroscedastic Bayesian Optimization for Risk-Aware AutoRL

    Jul 29, 2026Mingxuan Che, Tsung-Yuan Tseng, Theresa Eimer +2Multi-Objective Bayesian Optimization AlgorithmsBayesian Optimization

  12. Variational Quantum Conditional Boltzmann Machines for Time-Series Forecasting: Architectures, Symmetric Hyperparameter Evaluation, and a Nonlinear Benchmark

    Jul 27, 2026Gerhard Hellstern, Danyal Maheshwari, Martin Zaefferer +2Hybrid Quantum-Classical PipelineTime Series Forecasting

  13. Scale Weight Decay and Train Better

    Jul 26, 2026Anuj ApteWeight DecayBatch

  14. Do emulated quantum circuits change what CNNs look at? Performance and explainability comparison in medical image classification

    Jul 23, 2026Guillermo Rubiños Rodríguez, Martín Ottavianelli, Mateo Alonso +4Hybrid Quantum-Classical PipelineQuantum Circuits

  15. Which Hyperparameters Matter? A Game-Theoretic Framework for Interpretable Hyperparameter Sensitivity Analysis

    Jul 17, 2026Nyi Nyi Aung, Heepeom Shin, Abigail Lawlor +1HyperparameterShapley Value

  16. LeRoPE: Learnable RoPE Frequencies Improve Language Modeling

    Jul 11, 2026Petros Karypis, Sean O'Brien, Shreyas Kadekodi +2Rotary Position EmbeddingPositional Encoding

  17. Systematic Evaluation of Learning Rate Scheduling Strategies Across Heterogeneous Architectures

    Jul 9, 2026Hafsa Mateen, Radu Timofte, Dmitry IgnatovBatchNeural Architecture Search

  18. Beyond Heuristic Tuning: Power-Calibrated LLM Watermarking

    Jul 6, 2026Xiaopu Wang, Zelin He, Chengyuan Liu +1Large Language Model WatermarksWatermarking

  19. TabPack: Efficient Hyperparameter Ensembles for Tabular Deep Learning

    Jul 6, 2026Yury Gorishniy, Akim Kotelnikov, Ivan Rubachev +1Tabular LearningEnsemble

  20. Hyperparameter Transfer in Graph Neural Networks

    Jul 6, 2026Gage DeZoort, Boris HaninGraph Neural NetworksHyperparameter

  21. MMAO-Cls: Metabolic Multi-Agent Optimization for Joint Feature Selection and Classifier Tuning

    Jul 1, 2026Jinliang Xu, Liping MaFeature SelectionGeneral Grid Search Framework

  22. Mechanism-Driven Monitors for Preemptive Detection of LLM Training Instability

    Jun 26, 2026Ruixuan Huang, Yipei Wang, Wenyi Fang +7Large Language Model TrainingLarge Language Models Fail

  23. How Good Can Linear Models Be for Time-Series Forecasting?

    Jun 25, 2026Lang Huang, Jinglue Xu, Luke DarlowTime Series ForecastingTime Series

  24. Dual-Network PINNs for Optimal Control: A Reproducible Benchmark on the Mass-Spring-Damper System

    Jun 13, 2026Abdeladhim Tahimi, Rinaldo Vieira da Silva JuniorParametric Physics-Informed Neural NetworkOptimal Control

  25. Predictable Scaling Laws of Optimal Hyperparameters for LLM Continued Pre-training

    Jun 4, 2026Yongwei Zhou, Juncheng Diao, Junlin Shang +2HyperparameterPretraining

  26. Quantifying Hyperparameter Transfer and the Importance of Embedding Layer Learning Rate

    May 20, 2026Dayal Singh Kalra, Maissam BarkeshliHyperparameterLarge Language Model Training

  27. The Silent Hyperparameter: Quantifying the Impact of Inference Backends on LLM Reproducibility

    May 19, 2026David Pape, Jonathan Evertz, Lea SchönherrLarge Language Model BenchmarksLLM Inference Optimization

  28. Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters

    May 19, 2026Zhiyu Xu, Lean Wang, Yuanxin Liu +5Cross-ModalVision-Language Foundation Models

  29. Hyperparameter Transfer for Dense Associative Memories

    May 11, 2026Roi Holtzman, Dmitry Krotov, Boris HaninDense Associative MemoryHyperparameter

  30. Distributionally-Robust Learning to Optimize

    May 7, 2026Vinit Ranjan, Jisun Park, Bartolomeo StellatoDistributionally-Robust OptimizationConvex Optimization

  31. A Comprehensive Analysis of Tokenization and Self-Supervised Learning in End-to-End Automatic Speech Recognition applied on French Language

    May 5, 2026Thibault Bañeras-Roux, Mickael Rouvier, Jane Wottawa +1Automatic Speech RecognitionSubword Tokenization

  32. Enhancing RL Generalizability in Robotics through SHAP Analysis of Algorithms and Hyperparameters

    May 4, 2026Lingxiao Kong, Cong Yang, Oya Deniz Beyan +1Shapley Additive ExplanationsHyperparameter

  33. Large margin classifier with graph-based adaptive regularization

    May 3, 2026Vítor M. Hanriot, Turíbio T. Salis, Luiz C. B. Torres +2ClassifierClass Imbalance

  34. Learning Rate Transfer in Normalized Transformers

    Apr 29, 2026Boris Shigida, Boris Hanin, Andrey GromovBatchTransformer Architectures

  35. MesonGS++: Post-training Compression of 3D Gaussian Splatting with Hyperparameter Searching

    Apr 29, 2026Shuzhao Xie, Junchen Ge, Weixiang Zhang +103D GaussianLarge-Scale 3D Editing Dataset

  36. Scaling Probabilistic Transformer via Efficient Cross-Scale Hyperparameter Transfer

    Apr 28, 2026Penghao Kuang, Haoyi Wu, Kewei TuTransformer ArchitecturesHyperparameter

  37. First-Order Softmax Weighted Switching Gradient Method for Distributed Stochastic Minimax Optimization with Stochastic Constraints

    Mar 6, 2026Zhankun Luo, Antesh Upadhyay, Sang Bin Moon +1Decentralized OptimizationStochastic Optimization

  38. μμpscaling small models: Principled warm starts and hyperparameter transfer

    Feb 11, 2026Yuxin Ma, Nan Chen, Mateo Díaz +3HyperparameterNeural Network Training

  39. Selecting Hyperparameters for Tree-Boosting

    Feb 5, 2026Floris Jan Koster, Fabio SigristGradient Boosted Decision TreeGeneral Grid Search Framework

  40. Shapley-Inspired Feature Weighting in kk-means with No Additional Hyperparameters

    Aug 11, 2025Richard J. Fawley, Renato Cordeiro de AmorimK-MeansShapley Value

  41. Homogeneity Bias in Open-Weight LLMs Is Robust to Decoding Hyperparameters

    Jan 4, 2025Messi H. J. LeeLarge Language Model BiasGender

  42. Generalization Guarantees on Data-Driven Tuning of Gradient Descent with Langevin Updates

    Date pendingSaumya Goyal, Rohith Rongali, Ritabrata Ray +1Gradient DescentHyperparameter

  43. ExpTest: Loss-Curve Hypothesis Testing for Autonomous Learning-Rate Selection in Deep Neural Networks

    Date pendingZan Chaudhry, Naoko MizunoBatchHyperparameter