Policy Gradient Methods

Momentum

7 papers in the last four weeks, up 133% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 108

All topics
CardsList
  1. Sample Complexity of Policy Gradient for Log-Growth Control

    May 26, 2026Qiuhua Pan, Yukai Shen, Liwei Zhang +2Stochastic Linear Dynamical SystemsStochastic Optimal Control

  2. Credit-assigned Policy Gradient for Early Stage Retrieval in Two-stage Ranking

    May 25, 2026Haruka Kiyohara, Mihaela Curmei, Ariel Evnine +7Learning to RankInformation Retrieval

  3. Global Convergence of Wasserstein Policy Gradient for Entropy-Regularized Reinforcement Learning

    May 25, 2026Zhaoyu Zhu, Rui Gao, Shuang LiOptimization Convergence AnalysisWasserstein Gradient Flows

  4. Refined Analysis of Entropy-Regularized Actor-Critic

    May 23, 2026Safwan Labbi, Paul Mangold, Daniil Tiapkin +1Reinforcement LearningMaximum Entropy RL

  5. Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization

    May 20, 2026Zheyuan Zhang, Kaiwen Shi, Han Bao +3RL for Language Model ReasoningPolicy Optimization

  6. Equilibrium Selection in Multi-Agent Policy Gradients via Opponent-Aware Basin Entry

    May 18, 2026Yevhen Shcherbinin, Arina Redina, Maxim Kalpin +1Nash EquilibriumMulti-Agent Coordination

  7. Second-Order Actor-Critic Methods for Discounted MDPs via Policy Hessian Decomposition

    May 14, 2026Sanjeev Manivannan, Shuban VReinforcement LearningPolicy Gradient Methods

  8. Delightful Gradients Accelerate Corner Escape

    May 12, 2026Jincheng Mei, Ian OsbandMulti-Armed BanditsPolicy Gradient

  9. Revisiting Policy Gradients for Restricted Policy Classes: Escaping Myopic Local Optima with kk-step Policy Gradients

    May 11, 2026Alex DeWeese, Guannan QuPolicy GradientPolicy Optimization

  10. Policy Gradient Methods for Non-Markovian Reinforcement Learning

    May 11, 2026Avik Kar, Siddharth Chandak, Rahul Singh +4Reinforcement LearningPolicy Gradient Methods

  11. What should post-training optimize? A test-time scaling law perspective

    May 11, 2026Muheng Li, Jian Qian, Wenlong MouTest-Time ScalingBest-of-N Sampling

  12. Natural Policy Gradient as Doubly Smoothed Policy Iteration: A Bellman-Operator Framework

    May 11, 2026Phalguni Nanda, Zaiwei ChenPolicy GradientReinforcement Learning

  13. The Reciprocity Gradient

    May 8, 2026Yue Lin, Pascal Poupart, Shuhui Zhu +5Credit Assignment in RLPolicy Gradient Methods

  14. KL for a KL: On-Policy Distillation with Control Variate Baseline

    May 8, 2026Minjae Oh, Sangjun Song, Gyubin Choi +2Language Model DistillationPolicy Gradient Methods

  15. Actor-Critic with Active Importance Sampling

    May 8, 2026Majid Molaei, Gabor Paczolay, Matteo Papini +2Reinforcement LearningPolicy Gradient Methods

  16. Skip What You Can Predict: Predictive Repositioning for Policy Optimization for Efficient LLM Training

    May 7, 2026Ismam Nur Swapnil, Aranya Saha, Tasneea Zahra +3RL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  17. Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level

    May 7, 2026Nan Jia, Haojin Yang, Xing Ma +6RL for Language Model ReasoningLanguage Model Distillation

  18. Soft Deterministic Policy Gradient with Gaussian Smoothing

    May 7, 2026Hyunjun Na, Donghwan LeeRL ControlPolicy Gradient

  19. A2^2TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping

    May 7, 2026Dingwei Chen, Zefang Zong, Zhipeng Ma +5Credit Assignment in RLPolicy Gradient Methods

  20. On Training in Imagination

    May 7, 2026Nadav Timor, Ravid Shwartz-Ziv, Micah Goldblum +2Reward ModelingReinforcement Learning

  21. Non-Myopic Active Feature Acquisition via Pathwise Policy Gradients

    May 6, 2026Linus Aronsson, Morteza Haghir ChehreghaniPolicy GradientActive Learning

  22. Vanishing L2 regularization for the softmax Multi Armed Bandit

    May 5, 2026Stefana-Lucia Anita, Gabriel TuriniciMulti-Armed BanditsPolicy Gradient

  23. ANO: Robust Policy Optimization via Bounded, Redescending Gain Fields

    May 4, 2026Yiheng Zhang, Yiming Wang, Kaiyan Zhao +3Policy Gradient MethodsProximal Policy Optimization

  24. Global Optimality for Constrained Exploration via Penalty Regularization

    Apr 30, 2026Florian Wolf, Ilyas Fatkhullin, Niao HeConstrained RLMaximum Entropy RL

  25. Cost-Aware Learning

    Apr 30, 2026Clara Mohri, Amir Globerson, Haim Kaplan +2Stochastic OptimizationRL for Language Models

  26. Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning

    Apr 30, 2026Shijin Gong, Kai Ye, Jin Zhu +3Value Function EstimationRL for Language Model Reasoning