Gradient

Momentum

28 papers in the last four weeks, up 56% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 217

All topics
CardsList
  1. Scalable Derivative Gaussian Processes via Exact Gradient Reduction

    Jun 1, 2026Hyunseok Seung, Matthias KatzfussGaussian ProcessSurrogate Gradient

  2. CORE-MTL: Rethinking Gradient Balancing via Causal Orthogonal Representations

    Jun 1, 2026Chengfeng Wu, Tao Zou, Yanru Wu +1Multi--Task LearningRepresentation Learning

  3. Accurate Large-sample Uncertainty Quantification using Stochastic Gradient Markov Chain Monte Carlo

    May 29, 2026Yu Wang, Jie Ding, Jonathan H. HugginsStochastic Gradient DescentUncertainty Quantification

  4. Gradient Descent with Large Step Size Restores Symmetry in Deep Linear Networks with Multi-Pathway

    May 29, 2026Hee-Sung Kim, Sungyoon LeeDeep NetworkGradient Descent

  5. A2SG:Adaptive and Asymmetric Surrogate Gradients for Training Deep Spiking Neural Networks

    May 29, 2026Yechan Kang, Yongjin Kweon, Mingyeong Seo +8Spiking Neural NetworksSurrogate Gradient

  6. Efficient Test-Time Finetuning of LLMs via Convex Reconstruction and Gradient Caching

    May 28, 2026Alaa Khamis, Alaa MaaloufTest TimeMotion Reconstruction Branch

  7. SGMD: Score Gradient Matching Distillation for Few-Step Video Diffusion Distillation

    May 28, 2026Zhuguanyu Wu, Ruihao Gong, Yang Yong +5Video Diffusion ModelsAutoregressive Video Diffusion Models

  8. MōLe-Λ: Learning the Coupled-Cluster Response State for Energies, Gradients, and Properties

    May 28, 2026Andreas Burger, Luca Thiede, Abdulrahman Aldossary +4Quantum ChemistryDensity Functional Theory

  9. Natural Functional Gradients for Smooth Trajectory Optimization

    May 27, 2026Kisang Park, Chanwoo Kim, Kyungjae Lee +1Robotic ManipulationSmoothing

  10. Can Entry-Wise Clipping Give Spectral Control of Stochastic Gradients?

    May 26, 2026Zitao Song, Cedar Site Bai, Zhe Zhang +2Gradient ClippingStochastic Gradient Descent

  11. Robust Moment-Based Estimation via Spectral Gradient Reweighting

    May 26, 2026Liu Zhang, Amit SingerGaussian Mixture ModelsStochastic Gradient Descent

  12. Credit-assigned Policy Gradient for Early Stage Retrieval in Two-stage Ranking

    May 25, 2026Haruka Kiyohara, Mihaela Curmei, Ariel Evnine +7Policy GradientGradient

  13. Global Convergence of Wasserstein Policy Gradient for Entropy-Regularized Reinforcement Learning

    May 25, 2026Zhaoyu Zhu, Rui Gao, Shuang LiEntropy Regularized Reinforcement LearningPolicy Gradient

  14. Muon in Vision Transformers: Optimizer-Recipe Interactions and Gradient Spectra

    May 23, 2026Ben S. Southworth, Shuai Jiang, Daniel McBride +2Vision TransformerMuon

  15. Faithfulness as Information Flow: Evaluating and Training Faithful Chain-of-Thought Reasoning

    May 22, 2026Jinghan Jia, Joe Benton, Eric EasleyExplanation FaithfulnessFaithfulness

  16. Move on Muon : A Hamiltonian probability gradient flow perspective of Muon optimizer

    May 22, 2026Aratrika Mustafi, Soumya Mukherjee, Bharath K. SriperumbudurMuonWasserstein Gradient Flows

  17. EnCAgg: Enhanced Clustering Aggregation for Robust Federated Learning against Dynamic Model Poisoning

    May 21, 2026Tianyun Zhang, Zhen Yang, Haozhao Wang +2Federated LearningGradient-Based Attacks

  18. When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR

    May 19, 2026Yuchun Miao, Sen Zhang, Yuqi Zhang +4Reinforcement Learning With Verifiable RewardVerifiable Rewards

  19. The Symmetries of Three-Layer ReLU Networks

    May 18, 2026Johanna Marie Gegenfurtner, Moritz Grillo, Guido MontúfarRectified Linear Unit NetworksSymmetry

  20. Canonical Regularisation of Wide Feature-Learning Neural Networks

    May 18, 2026George Whittle, Pranav Vaidhyanathan, Juliusz Ziomek +2Feature LearningRegularization

  21. New Insight of Variance reduce in Zero-Order Hard-Thresholding: Mitigating Gradient Error and Expansivity Contradictions

    May 18, 2026Xinzhe Yuan, William de Vazelhes, Bin Gu +1Variance ReductionAdaptive Thresholding

  22. Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking

    May 15, 2026Vaidehi Bagaria, Nikshep Grampurohit, Pulkit VermaReinforcement Learning With Verifiable RewardGradient

  23. Multi-Headed Transformer Architectures as Time-dependent Wasserstein Gradient Flows

    May 15, 2026Alex Massucco, Leonardo Del Grande, Marcello Carioni +2Transformer ArchitecturesWasserstein Gradient Flows

  24. Policy Optimization in Hybrid Discrete-Continuous Action Spaces via Mixed Gradients

    May 14, 2026Matias Alvo, Daniel Russo, Yash KanoriaAction SpaceGradient

  25. HarmoGS: Robust 3D Gaussian Splatting in the Wild via Conflict-Aware Gradient Harmonization

    May 13, 2026Yulei Kang, Tianze Zhu, Jian-Fang Hu +23D Gaussian3D Generation

  26. Sobolev Regularized MMD Gradient Flow

    May 12, 2026Chenyang Tian, Bharath K. Sriperumbudur, Arthur Gretton +1Maximum Mean DiscrepancyWasserstein Gradient Flows

  27. One-Step Generative Modeling via Wasserstein Gradient Flows

    May 12, 2026Jiaqi Han, Puheng Li, Qiushan Guo +3Diffusion ModelsGenerative Models

  28. Flag Varieties: A Geometric Framework for Deep Network Alignment

    May 11, 2026Jingchuan Xiao, Xinyi Sui, Cihan RuanNeural CollapseSubspace

  29. Probability-Flow Distillation: Exact Wasserstein Gradient Flow for High-Fidelity 3D Generation

    May 9, 2026Rohith Ramanan, A. N. Rajagopalan3D Generative ModelsHigh-Fidelity 3D Generation

  30. A Call to Lagrangian Action: Learning Population Mechanics from Temporal Snapshots

    May 8, 2026Vincent Guan, Lazar Atanackovic, Kirill NeklyudovLagrangian MethodsPopulation Dynamics

  31. The Reciprocity Gradient

    May 8, 2026Yue Lin, Pascal Poupart, Shuhui Zhu +5Policy GradientReputation

  32. Flatness and Gradient Alignment Are Both Necessary: Spectral-Aware Gradient-Aligned Exploration for Multi-Distribution Learning

    May 8, 2026Aristotelis Ballas, Christos DiouGradientValue Alignment

  33. Gradient Starvation in Binary-Reward GRPO: Why Group-Mean Centering Fails and Why the Simplest Fix Works

    May 8, 2026Wenhua Nie, Jianan Wu, Junlin Liu +6Gradient

  34. Skip What You Can Predict: Predictive Repositioning for Policy Optimization for Efficient LLM Training

    May 7, 2026Ismam Nur Swapnil, Aranya Saha, Tasneea Zahra +3Frictive Policy OptimizationGroup-Based Reinforcement Learning

  35. FRInGe: Distribution-Space Integrated Gradients with Fisher--Rao Geometry

    May 7, 2026Gabriele Martino, Sebastian TschiatschekGradient-Weighted Class Activation MappingGradient

  36. Soft Deterministic Policy Gradient with Gaussian Smoothing

    May 7, 2026Hyunjun Na, Donghwan LeePolicy GradientValue Functions

  37. Learning Discrete Autoregressive Priors with Wasserstein Gradient Flow

    May 7, 2026Bowen Zheng, Yihong Luo, Tianyang HuVisual TokenizersAutoregressive Image Generation

  38. Medical Imaging Classification with Cold-Atom Reservoir Computing using Auto-Encoders and Surrogate-Driven Training

    May 7, 2026Nuno Batista, Ana Morgado, Oscar Ferraz +3Hybrid Quantum-Classical PipelineReservoir Computing

  39. Architecture Shape Governs QNN Trainability: Jacobian Null Space Growth and Parameter Efficiency

    May 7, 2026Michael Poppel, David Bucher, Maximilian Zorn +5Variational Quantum CircuitsJacobian

  40. Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio

    May 7, 2026Ziqing Wen, Zhouyang Liu, Jiahuan Wang +4AdamGradient

  41. Optimal Confidence Band for Kernel Gradient Flow Estimator

    May 7, 2026Yuqian Cheng, Zhuo Chen, Qian LinConfidence IntervalsWasserstein Gradient Flows

  42. Accelerating LMO-Based Optimization via Implicit Gradient Transport

    May 7, 2026Won-Jun Jang, Si-Hyeon LeeAdaptive OptimizersGradient

  43. Gradients with Respect to Semantics Preserving Embeddings Tell the Uncertainty of Large Language Models

    May 6, 2026Mingda Li, Rundong Lv, Xinyu Li +2Large Language Model UncertaintyLarge Language Model Generation

  44. Floating-Point Networks with Automatic Differentiation Can Represent Almost All Floating-Point Functions and Their Gradients

    May 3, 2026Sejun Park, Yeachan Park, Geonho HwangFloating-PointActivation Functions

  45. Gradient Regularized Newton Boosting Trees with Global Convergence

    May 1, 2026Nikita Zozoulenko, Daniel Falkowski, Thomas Cass +1Gradient Boosted Decision TreeConvex Loss

  46. LambdaRankIC: Directly Optimizing Rank IC for Financial Prediction

    May 1, 2026Yan Lin, Yihong Su, Yi YangLow-Rank StructureCredit Risk Prediction

  47. Federated Learning with Hypergradient-based Online Update of Aggregation Weights

    May 1, 2026Ayano Nakai-Kasai, Tadashi WadayamaFederated LearningPower Allocation