Policy Gradient

Latest papers 75

All topics
CardsList
  1. OPTS-TTPO: Enhancing Finite-Sample Policy-Gradient Learning with Tree Search

    Sep 30, 2026Junyu Lu, Shichao Weng, Zhiqiang Wang +10Frictive Policy OptimizationPolicy Gradient

  2. Sufficiency of Zeroth-Order Reward Shaping for Policy Gradient in Stabilization Control

    Sep 28, 2026Yisheng Zhang, Tao Wang, Sicun GaoPotential-Based Reward ShapingPolicy Gradient

  3. HiLoRe: What to Store, Compress, or Recompute for Efficient GRPO Training

    Sep 27, 2026Xinrui Chen, Mengyang Li, Ou Wu +1Policy Gradient

  4. OSCC: Certified Observation-Safe Coupling Optimization for Gradient-Noise Control in Imperfect-Information Learning

    Sep 27, 2026Miaobo Hu, Shuhao Hu, Xiaobo Guo +5Optimal LearnerPolicy Gradient

  5. Reinforcement Learning with Decomposed Subtasks

    Sep 22, 2026Mattie Terzolo, Mikolaj Sacha, Ayan Sinha +1Policy GradientAgentic Benchmarks

  6. CAST: Alternating State-Value Targets and Expanded Policy Gradients for Model-Based Reinforcement Learning

    Sep 8, 2026Pietro Noah Crestaz, Mohamed Yassine Kabouri, Nicolas Mansard +1Model-Based Reinforcement LearningPolicy Gradient

  7. Emergent Charging Coordination in Electric Delivery Fleets

    Sep 7, 2026Javier Vales-Alonso, Juan J. AlcarazElectric VehiclesDemand Response

  8. Boundary-Seeking Policy Gradient for Safe Reinforcement Learning

    Aug 10, 2026Chenhua Fan, Jiahui Zhu, Yuhang Zhang +1Policy GradientSafety Constraints

  9. Wasserstein Policy Gradient for Entropy-Regularized Linear-Quadratic Control

    Aug 7, 2026Zhaoyu Zhu, Rui Gao, Shuang LiEntropy Regularized Reinforcement LearningLinear Quadratic Regulator

  10. Convergence and Regret of the Policy Gradient for Multi-Armed Bandits in Diffusion Environment

    Jul 31, 2026Yanwei Jia, Du OuyangPolicy GradientStochastic Multi-Armed Bandits

  11. Policy Gradient Steering: Interventions from Behavioral Objectives

    Jul 30, 2026Yoann Poupart, Aurélie Beynier, Nicolas MaudetPolicy GradientSteering

  12. Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR

    Jul 28, 2026Pixel Nomand, Elena Voss, Marcus Hale +1Reinforcement Learning With Verifiable RewardToken Budget Allocation

  13. Finite-Time Analysis of the Natural Policy Gradient in Finite-Horizon Markov Decision Processes

    Jul 25, 2026Asha Barua, Sajad KhodadadianPolicy GradientMarkov Decision Processes

  14. Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits

    Jul 24, 2026Yuta Natsubori, Masataka Ushiku, Yuta SaitoContextual Bandit FrameworkOff-Policy Learning

  15. Optimizing Regret

    Jul 21, 2026Irene AldridgeRegretPolicy Gradient

  16. Mask-Aware Policy Gradients for Diffusion Language Models

    Jul 16, 2026Haran Raajesh, Kulin Shah, Adam Klivans +1Masked Diffusion Language ModelsLarge Language Model Reinforcement Learning

  17. Environment Parameter Gradient Theorem for Policy-Environment Co-Design in Reinforcement Learning

    Jul 14, 2026Amber SrivastavaPolicy GradientValue Functions

  18. SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions

    Jul 9, 2026Elham Daneshmand, Majid Khadiv, Glen Berseth +1Proximal Policy OptimizationPolicy Gradient

  19. Mean Field Reinforcement Learning

    Jul 1, 2026René Carmona, Mathieu LaurièreStochastic Optimal ControlMulti-Agent Reinforcement Learning

  20. Superhuman AI for Generals.io Using Self-Play Reinforcement Learning

    Jun 22, 2026Matej Straka, Viliam Lisý, Martin SchmidSelf-PlaySimulation-Based Reinforcement Learning

  21. Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

    Jun 20, 2026Zhao Yang, Yuxuan Jiang, Ting-Chih Chen +18Large Language Model Reinforcement LearningOffline Reinforcement Learning

  22. Redesigning Regularization for Effective Policy Smoothing

    Jun 11, 2026Taisuke Kobayashi, Naoto YamanakaSmoothingPolicy Gradient

  23. On Advantage Estimates for Max@K Policy Gradients

    Jun 4, 2026Shota Takashiro, Soichiro Nishimori, Paavo Parmas +6Policy GradientStep-Level Advantage Estimation

  24. Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models

    Jun 3, 2026Chirag Chawla, Rohan Charudatt Salvi, Madhav S. BaidyaPolicy GradientOffline Reinforcement Learning

  25. Policy Gradient for Continuous-Time Robust Markov Decision Processes

    Jun 3, 2026Tanya Veeravalli, David M. Bossens, Atsushi NitandaMarkov Decision ProcessesPolicy Gradient

  26. EchoRL: Reinforcement Learning via Rollout Echoing

    May 29, 2026Jinhe Bi, Aniri, Minglai Yang +9Reinforcement Learning With Verifiable RewardLarge Language Model Training

  27. Convergence of Steepest Descent and Adam under Non-Uniform Smoothness

    May 28, 2026Sharan Vaswani, Yifan Sun, Reza BabanezhadGradient DescentSmoothness

  28. Completion vs Optimality: Policy Gradient in Long-Horizon Cumulative-Damage Problems

    May 26, 2026Wolfgang Maass, Sabine JanzenPolicy GradientOptimality

  29. Sample Complexity of Policy Gradient for Log-Growth Control

    May 26, 2026Qiuhua Pan, Yukai Shen, Liwei Zhang +2Policy GradientStochastic Optimal Control

  30. Efficient On-policy Visual-RL via Stochastic Decoupled Policy Gradient

    May 26, 2026Haoxiang You, Yilang Liu, Davis Zong +5Visuomotor PolicyFrictive Policy Optimization

  31. Credit-assigned Policy Gradient for Early Stage Retrieval in Two-stage Ranking

    May 25, 2026Haruka Kiyohara, Mihaela Curmei, Ariel Evnine +7Policy GradientGradient

  32. Global Convergence of Wasserstein Policy Gradient for Entropy-Regularized Reinforcement Learning

    May 25, 2026Zhaoyu Zhu, Rui Gao, Shuang LiEntropy Regularized Reinforcement LearningPolicy Gradient

  33. DeepSeekMath Meets Order Book: Group-Aware Policy Optimization for High-Frequency Directional Trading

    May 25, 2026Sayak Charabarty, Souradip PalPolicy GradientReinforcement Learning Baseline

  34. DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards

    May 20, 2026Kaiyi Zhang, Wei Wu, Yankai LinReinforcement Learning With Verifiable RewardCredit Assignment

  35. The Dynamics of Policy Gradient in Social Dilemmas with Partner Selection

    May 18, 2026Benedict Russell, Chin-wing Leung, Paolo TurriniCooperationPolicy Gradient

  36. Equilibrium Selection in Multi-Agent Policy Gradients via Opponent-Aware Basin Entry

    May 18, 2026Yevhen Shcherbinin, Arina Redina, Maxim Kalpin +1Nash EquilibriumEquilibrium

  37. Scalable Bi-causal Optimal Transport via KL Relaxation and Policy Gradients

    May 17, 2026Haoyang Cao, Jesse Hoekstra, Renyuan Xu +2Optimal Transport ApproachStochastic Optimization

  38. Collaborative Yet Personalized Policy Training: Single-Timescale Federated Actor-Critic

    May 14, 2026Leo Muxing Wang, Pengkun Yang, Lili SuSoft Actor-CriticMulti-Agent Reinforcement Learning

  39. AIS: Adaptive Importance Sampling for Quantized RL

    May 13, 2026Jiajun Zhou, Wei Shao, Lingchao Zheng +2Large Language Model Reinforcement LearningAdaptive Sampling

  40. Delightful Gradients Accelerate Corner Escape

    May 12, 2026Jincheng Mei, Ian OsbandPolicy GradientOptimal Policies

  41. Epistemic Uncertainty for Test-Time Discovery

    May 11, 2026Kainat Riaz, Muhammad Ahmed Mohsin, Ahsan Bilal +5Model DiscoveryStochastic Exploration

  42. Revisiting Policy Gradients for Restricted Policy Classes: Escaping Myopic Local Optima with kk-step Policy Gradients

    May 11, 2026Alex DeWeese, Guannan QuPolicy GradientOptimal Policies

  43. Policy Gradient Methods for Non-Markovian Reinforcement Learning

    May 11, 2026Avik Kar, Siddharth Chandak, Rahul Singh +4Markov Decision ProcessesPolicy Gradient

  44. Natural Policy Gradient as Doubly Smoothed Policy Iteration: A Bellman-Operator Framework

    May 11, 2026Phalguni Nanda, Zaiwei ChenPolicy GradientBoltzmann Policies

  45. The Reciprocity Gradient

    May 8, 2026Yue Lin, Pascal Poupart, Shuhui Zhu +5Policy GradientReputation

  46. Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level

    May 7, 2026Nan Jia, Haojin Yang, Xing Ma +6Efficient On-Policy DistillationPolicy Gradient

  47. Soft Deterministic Policy Gradient with Gaussian Smoothing

    May 7, 2026Hyunjun Na, Donghwan LeePolicy GradientValue Functions

  48. Vanishing L2 regularization for the softmax Multi Armed Bandit

    May 5, 2026Stefana-Lucia Anita, Gabriel TuriniciEntropy Regularized Reinforcement LearningPolicy Gradient