Policy Gradient Methods

Momentum

7 papers in the last four weeks, up 133% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 108

All topics
CardsList
  1. Bayesian policy gradient and actor-critic algorithms

    Apr 30, 2026Mohammad Ghavamzadeh, Yaakov Engel, Michal ValkoBayesian RLTemporal-Difference Learning

  2. Dynamical Priors as a Training Objective in Reinforcement Learning

    Apr 23, 2026Sukesh SubaharanReinforcement LearningPolicy Gradient Methods

  3. EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training

    Apr 21, 2026Chengjun Pan, Shichun Liu, Jiahang Lin +10RL for Language ModelsPolicy Gradient Methods

  4. Intentional Updates for Streaming Reinforcement Learning

    Apr 21, 2026Arsalan Sharifnassab, Mohamed Elsayed, Kris De Asis +2Reinforcement LearningTemporal-Difference Learning

  5. Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback

    Apr 21, 2026Qiang Liu, Adrienne Kline, Ermin WeiConstrained RLPolicy Gradient Methods

  6. COSAC: Counterfactual Credit Assignment in Sequential Cooperative Teams

    Apr 20, 2026Shripad Deshmukh, Jayakumar Subramanian, Raghavendra Addanki +1Sequential MARLCredit Assignment in RL

  7. Softmax gradient policy for variance minimization and risk-averse multi armed bandits

    Mar 31, 2026Gabriel TuriniciMulti-Armed BanditsPolicy Gradient Methods

  8. ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning

    Feb 25, 2026Xiaoxuan Wang, Han Zhang, Haixin Wang +11Agentic RLReinforcement Learning

  9. Reinforcement learning with an expectile-based objective

    Feb 10, 2026Shrey Rakeshkumar Patel, Sumedh Gupte, Soumen Pachal +2Reinforcement LearningRisk-Sensitive RL

  10. The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL

    Feb 6, 2026Yingru Li, Jiawei Xu, Ziniu Li +10RL for Language Model ReasoningPolicy Gradient Methods

  11. Rethinking the Design Space of Reinforcement Learning for Diffusion Models: On the Importance of Likelihood Estimation Beyond Loss Design

    Feb 4, 2026Jaemoo Choi, Yuchen Zhu, Wei Guo +6T2I GenerationDiffusion Model Fine-Tuning

  12. Model-Free Output Feedback Stabilization via Policy Gradient Methods

    Jan 27, 2026Ankang Zhang, Ming Chi, Xiaoling Wang +1Dynamical SystemsPartially Observable RL

  13. Trust Region Masking for Long-Horizon LLM Reinforcement Learning

    Dec 28, 2025Yingru Li, Jiacai Liu, Jiawei Xu +4RL for Language ModelsReinforcement Learning

  14. Rethinking the Global Convergence of Softmax Policy Gradient with Linear Function Approximation: The Case of Multi-Armed Bandits

    May 6, 2025Max Qiushi Lin, Jincheng Mei, Matin Aghaei +6Multi-Armed BanditsPolicy Gradient

  15. Reflective Policy Optimization

    Jun 6, 2024Yaozhong Gan, Renye Yan, Zhe Wu +1Policy OptimizationPolicy Gradient Methods

  16. On the Approximation and Convergence of Distributional Policy Gradient Algorithms for Risk-Sensitive Reinforcement Learning

    May 23, 2024Xian Yu, Minheng Xiao, Lei YingStochastic OptimizationDistributional RL