Hessian

Momentum

12 papers in the last four weeks, up 50% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 92

All topics
CardsList
  1. Classical Hardness of Learning Functions of Hamiltonians

    Oct 1, 2026Sota Hashimoto, Akinori KawachiQuantum LearningQuantum Machine Learning

  2. Near-Linear Accuracy Bounds for Moreau--Yosida Unadjusted Langevin Sampling

    Sep 30, 2026Yuchen Xin, Zhihua ZhangLangevin DynamicsLipschitz Continuity

  3. A Generalisation Signal Need Not Be a Model-Selection Signal

    Sep 30, 2026Aditya Nagarsekar, M P Ashish Bhat, Aadi Nesarkar +5Model SelectionSpearman Correlation

  4. Deep kernel hedging

    Sep 28, 2026Jean-Loup Dupret, Donatien Hainaut, Edouard MotteHessianEmpirical Risk Minimization

  5. The Composition Gap in Dataset Distillation

    Sep 28, 2026Guang Li, Takahiro Ogawa, Miki HaseyamaDiffusion-Based Dataset DistillationProbe-Logit Distillation

  6. Beyond Scalar Sensitivity: Activation-Aware Mixed-Precision LLM Quantization with Cross-Layer Refinement

    Sep 22, 2026Akihiro Yoshida, Yuma IchikawaMixed-Precision QuantizationLarge Language Model Quantization

  7. Hessian Rank Constraint for Learning Structure of Nonlinear Latent Variable Models

    Sep 21, 2026Zijian Li, Ruichu Cai, Feng Xie +7HessianLatent Variable

  8. LiLi: Lie Theory Based 3D LiDAR Scan Alignment Degeneracy Detection

    Sep 15, 2026Vsevolod Hulchuk, Jan Bayer, Jan FaiglHomographyLie Group

  9. Optimization over covariance matrices with a parameterized metric

    Sep 15, 2026Yibang Li, Bamdev Mishra, Pratik Jawanpuria +1Riemannian OptimizationHessian

  10. Federated stochastic bilevel optimization with fully first-order gradients

    Sep 14, 2026Yihan Zhang, Rohit Dhaipule, Chiu C Tan +2Bilevel OptimizationGradient Descent

  11. Correlation-Guided Fast Machine Unlearning via Hessian Analysis

    Sep 14, 2026Ayushi Thakur, Ruchir Gupta, Amit Kumar Jaiswal +1Machine UnlearningPrivacy-Preserving Machine Learning

  12. Hard-ReLU Gradient Descent Selects an Event-Free Sensitivity Limit

    Aug 31, 2026Xiaoyang Li, Runni ZhouGradientLocal Curvature

  13. Functional Degeneracy in Neural Networks: Measurement and Pruning

    Aug 31, 2026Maria Matveev, Pascal Esser, Ayush Bharadwaj +2Unstructured PruningNeural Network

  14. Curvature Cryptanalysis of Smooth Transformer Feed-Forward Networks

    Aug 28, 2026Munawar Hasan, Apostol VassilevFeed-ForwardTransformer Architectures

  15. A Compositional Theory of Curvature in Probabilistic Circuits

    Aug 13, 2026Hrithik Suresh, Sahil Sidheekh, Shelar Parth Vijay +3Sharpness-Aware MinimizationProbabilistic Model

  16. Efficient Hessian-Free Methods for Multi-Objective Bilevel Optimization with Nonconvex Lower Level

    Aug 13, 2026Yicong Jiang, Feihu HuangBilevel OptimizationMulti-Objective Optimization

  17. HAMP-LIC: Hessian-Aware Mixed-Precision Post-Training Quantization for Learned Image Compression

    Aug 12, 2026Yuefeng ZhangLearned Image CompressionGenerative Image Compression

  18. Efficient Hypergradient Descent for Inverse Reinforcement Learning

    Aug 11, 2026Nikita Sevriukov, Anna Barabanova, Uliana Gagarina +4Offline Reinforcement LearningReward Functions

  19. Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization

    Aug 8, 2026Ketong Shao, Jialu Wang, Xuekai Pei +1Bayesian OptimizationHessian

  20. Establishing Boundary KKT Convergence of Mirror Descent through Reparameterization

    Aug 7, 2026Kuangyu Ding, Kim-Chuan TohMirror DescentConvergence

  21. Cascading Through the Hierarchy: Regularizer-Induced Feature Detection as Phase Transitions in Deep Linear Neural Networks

    Aug 6, 2026Björn Ladewig, Ibrahim Talha Ersoy, Karoline WiesnerFeature LearningAnisotropic Loss Landscapes

  22. BaKron: Efficient Quantization with Kronecker-Factored Hessians

    Aug 6, 2026Johann Birnick, Rayan SaabHessianMatrix Multiplication

  23. The Condition-Number Barrier in Sparse Least Squares

    Aug 3, 2026Honghao Lin, Vahab Mirrokni, David P. WoodruffConvex OptimizationLeast Squares

  24. SPRKD: Effective Knowledge Distillation for Deep Neural Networks via Saddle Region Approximation

    Jul 25, 2026Aditya Dewan, Arjun Yogeswaran, Benjamin FedorukKnowledge DistillationHessian

  25. \k{appa}-LoRA: Condition Numbers Reveal Which LoRA Matrices Worth Updating

    Jul 24, 2026Jianghui Wang, Silong Yong, Francesco Orabona +3Multi-LoraLow-Rank Structure

  26. A Defense of the Quadratic Model

    Jul 23, 2026Alexandru Meterez, Pranav Ajit Nair, Depen Morwani +3Anisotropic Loss LandscapesLarge Language Model Training

  27. How the Hessian-Spectrum of Neural Networks Depends on Data

    Jul 15, 2026Jasraj Singh, Enea Monzio Compagnoni, Antonio OrvietoHessianTwo-Layer Neural Networks

  28. Dynamics of Gradient Descent with Large Step Size Near a Manifold of Flat Minima

    Jul 9, 2026Lachlan Ewen MacDonald, René VidalGradient DescentHessian

  29. KronQ: LLM Quantization via Kronecker-Factored Hessian

    Jul 8, 2026Donghyun Lee, Yuhang Li, Ruokai Yin +1Large Language Model QuantizationPost-Training Quantization

  30. Explaining Near-Zero Hessian Eigenvalues Through Approximate Symmetries in Neural Networks

    Jul 8, 2026Marcel Kühn, Bernd RosenowHessianAnisotropic Loss Landscapes

  31. On the Condition Number Upper Bound of the L-BFGS Inverse Hessian Approximation Matrix with a Two-Sided Geometric Envelope Safeguarding Mechanism

    Jul 7, 2026Don LiHessianNewton

  32. Directional Curvature from Armijo Backtracking: A Low-Cost Sharpness Probe and a Calibration-Free Learning-Rate Safeguard for Adam

    Jul 4, 2026Ashmitha R, Jörg FrochteAdamSharpness-Aware Minimization

  33. Why can genetic algorithms work in high-dimensional search spaces?

    Jun 29, 2026Stephen WhitelamGenetic AlgorithmsGradient Descent

  34. Curvature-Weighted Gradient Diversity: A Noise Measure for Geometry-Adaptive SGD Schedules

    Jun 29, 2026Muhammad Hamza, Ayush GoelStochastic Gradient DescentHessian

  35. Characterizing Optimizer-Dependent Training Dynamics Through Hessian Eigenvector Displacement and Localization

    Jun 29, 2026Marcelina Marjankowska, Valerio Modugno, Paolo BaruccaHessianLocal Curvature

  36. Closed-Form Steepest Descent Direction toward Flat Minima: Reducing Upper Bounds on the Loss Hessian Eigenspectrum in Neural Networks

    Jun 27, 2026Yuto Omae, Kazuki Sakai, Yohei Kakimoto +3HessianGradient Descent

  37. The Degeneracy Distillery

    Jun 22, 2026T. Lucas Makinen, Deaglan J. Bartlett, Niall Jeffrey +1Fisher Information MatrixHessian

  38. Hessian-augmented Supervised Learning for Hamilton-Jacobi-Bellman PDEs

    Jun 22, 2026Matías Gómez-Aedo, Behzad Azmi, Yuyang Huang +2Optimal ControlHamilton-Jacobi Reachability

  39. Finite-Sample Performance of Gradient Descent in Logistic Regression with Gaussian Design

    Jun 19, 2026Junren Chen, Arya MazumdarLogistic RegressionFinite-Sample

  40. Interactive Pareto navigation for deep multi-task learning

    Jun 17, 2026Augustina C. Amakor, Konstantin Sonntag, Sebastian PeitzPareto FrontierMulti-Objective Reinforcement Learning

  41. Taming Curvature: Architecture Warm-Up for Stable Transformer Training

    Jun 15, 2026Sameera Ramasinghe, Ajanthan Thalaiyasingam, Hadi Mohaghegh Dolatabadi +6Curvature-Aware Spectral FrameworkTransformer Architectures

  42. Accelerating SAV-based optimization via randomized low-rank Hessian approximation

    Jun 9, 2026Ryo Sagawa, Daisuke Furihata, Yuto MiyatakeHessianNewton

  43. Neural Legendre-Fenchel transform with Hessian Preconditioning

    Jun 8, 2026Basile Plus-Gourdon, Frank NielsenSpectral PreconditioningHessian

  44. REFINE: Super-efficient 3D Gaussian Splatting Pruning via Rendering-Free Primitive Importance

    Jun 8, 2026Zhang Chen, Shuai Wan, Mengting Yu +2Dynamic 3D Gaussian Splatting3D Gaussian

  45. Sharp First-Order Lower Bounds for Higher-Order Smooth Nonconvex Optimization

    Jun 3, 2026Dongruo ZhouStochastic Convex OptimizationFirst Order Oracle Complexity

  46. A Geometric Characterization of the Stationary Plateau for Two-Layer Neural Networks

    Jun 3, 2026Tian Ding, Dawei Li, Ruoyu SunTwo-Layer Neural NetworksAnisotropic Loss Landscapes

  47. Learning Chaotic Dynamics through Second-Order Geometric Supervision

    Jun 1, 2026Shinhoo Kang, Hai V. Nguyen, Tan Bui-ThanhChaosJacobian

  48. Rethinking Bregman Divergences in Kronecker-Factored Optimizers

    May 30, 2026Bing Liu, Wenjie Zhou, Chengcheng ZhaoSpectral PreconditioningBregman Divergences

  49. Exploiting weight-space symmetries for approximating curvature

    May 30, 2026Artem Artemev, Rui Xia, Benjamin M. Boyd +4Local CurvatureHessian

  50. Improved Guarantees for Langevin Monte Carlo with Average Smoothness

    May 29, 2026Arnak S. Dalalyan, Avetik KaragulyanLangevin DynamicsLog-Concave Distributions

  51. Revisiting Zeroth-Order Hessian Approximation: A Single-Step Policy Optimization Lens

    May 29, 2026Junbin Qiu, Zhaowei Hong, Renzhe Xu +1HessianZeroth-Order