Policy Gradient Methods

Momentum

7 papers in the last four weeks, up 133% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 108

All topics
CardsList
  1. Randomized Transport Maps for Model-Free Policy-Gradient Mean-Field Control

    Oct 8, 2026Adonis Jamal, Samy Mekkaoui, Yadh Hafsi +1Policy Gradient MethodsModel-Free RL

  2. Temporally Interpretable Differentiable Decision Trees

    Oct 7, 2026Eisuke Hirota, Aarav Sane, Rohan PalejaInterpretable MLInterpretability in RL

  3. A Closed-Loop Non-Asymptotic Convergence Analysis of PPO with Learned Critics and Clipping

    Oct 7, 2026Junwei Su, Mengfan Liu, Yanyong Zhang +1Proximal Policy OptimizationActor-Critic Methods

  4. Convex-Concave Reinforcement Learning

    Oct 6, 2026Shripad V. Deshmukh, Yaswanth Chittepu, Dhawal Gupta +2Reinforcement LearningPolicy Gradient Methods

  5. OPTS-TTPO: Enhancing Finite-Sample Policy-Gradient Learning with Tree Search

    Sep 30, 2026Junyu Lu, Shichao Weng, Zhiqiang Wang +10Tree SearchPolicy Gradient Methods

  6. Regularized policy gradient with learned mixtures of Gaussians for games with continuous actions

    Sep 29, 2026Ondřej Kubíček, Viliam Lisý, Tuomas SandholmGame-Playing AgentsSelf-Play RL

  7. ORPG: Reconciling Multiple Reward Objectives through Objective-wise Policy Gradients

    Sep 28, 2026Shicheng Fang, Yiwen Zhao, Wenbo Tian +4Multi-Objective Reinforcement LearningGradient Interference

  8. Sufficiency of Zeroth-Order Reward Shaping for Policy Gradient in Stabilization Control

    Sep 28, 2026Yisheng Zhang, Tao Wang, Sicun GaoReward ShapingRobotic RL

  9. OSCC: Certified Observation-Safe Coupling Optimization for Gradient-Noise Control in Imperfect-Information Learning

    Sep 27, 2026Miaobo Hu, Shuhao Hu, Xiaobo Guo +5Partially Observable RLPolicy Gradient Methods

  10. Designing Reinforcement Learning for Diffusion Models: A Unified Path-Space View

    Aug 14, 2026Yixian Xu, Yuanrui Zhang, Shengjie Luo +2Diffusion Model AlignmentPolicy Gradient Methods

  11. The Time Value of Evolution

    Aug 13, 2026Matthew Siper, Ahmed Khalifa, Julian TogeliusEvolutionary OptimizationPolicy Gradient Methods

  12. Boundary-Seeking Policy Gradient for Safe Reinforcement Learning

    Aug 10, 2026Chenhua Fan, Jiahui Zhu, Yuhang Zhang +1Markov Decision ProcessesConstrained RL

  13. Wasserstein Policy Gradient for Entropy-Regularized Linear-Quadratic Control

    Aug 7, 2026Zhaoyu Zhu, Rui Gao, Shuang LiMaximum Entropy RLPolicy Gradient Methods

  14. Convergence and Regret of the Policy Gradient for Multi-Armed Bandits in Diffusion Environment

    Jul 31, 2026Yanwei Jia, Du OuyangMulti-Armed BanditsRegret Minimization in RL

  15. CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

    Jul 28, 2026Bo-Wen Zhang, Junwei He, Wen Wang +5Token-Level Credit AssignmentRubric-Based RL

  16. Finite-Time Analysis of the Natural Policy Gradient in Finite-Horizon Markov Decision Processes

    Jul 25, 2026Asha Barua, Sajad KhodadadianPolicy GradientMarkov Decision Processes

  17. Exposure-Based Reinforcement Learning to Rank

    Jul 21, 2026Harrie Oosterhuis, Rolf Jagerman, Zhen Qin +1Reinforcement LearningLearning to Rank

  18. Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces

    Jul 20, 2026Dongming Wang, Pengcheng Dai, Wenwu Yu +1Multi-Agent ControlTemporal-Difference Learning

  19. CLaC@FinMMEval 2026 Task 3: Sentiment-Augmented Deep Reinforcement Learning for Active Trading -- An Alpha-Reward Approach

    Jul 17, 2026Andrei Neagu, Eeham Khan, Leila KosseimReinforcement LearningDeep Q-Learning

  20. Mask-Aware Policy Gradients for Diffusion Language Models

    Jul 16, 2026Haran Raajesh, Kulin Shah, Adam Klivans +1Masked Diffusion ModelsRL for Language Model Reasoning

  21. Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning

    Jul 15, 2026Bowei He, Yankai Chen, Xiaokun Zhang +1Reinforcement LearningPolicy Gradient Methods

  22. UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

    Jul 8, 2026Chongyu Fan, Pengfei Liu, Jingjia Huang +2RL for Language Model ReasoningPolicy Optimization

  23. ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy

    Jul 3, 2026Zijun Xie, Yuyang You, Yongzhi Li +6Token-Level Credit AssignmentRL for Language Model Reasoning

  24. One More Time: Revisiting Neural Quantum States from a Reinforcement Learning Perspective

    Jul 2, 2026Juan Agustín Duque, Sergio García Heredia, Vinicius Hernandes +4Neural Quantum StatesSecond-Order Optimization

  25. Mean Field Reinforcement Learning

    Jul 1, 2026René Carmona, Mathieu LaurièreReinforcement LearningQ-Learning