Policy Gradient Methods

Momentum

7 papers in the last four weeks, up 133% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 108

All topics
CardsList
  1. EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games

    Jun 22, 2026Tristan Maidment, JB Lanier, Chase McDonald +5Self-Play RLImperfect-Information Games

  2. KLip-PPO: A per-sample KL perspective on PPO-Clip

    Jun 22, 2026Riccardo Colletti, Robin HolzingerKL-Regularized RLPolicy Gradient Methods

  3. Drowning in Routine: Signal Dilution in Multi-Turn Agent Training

    Jun 20, 2026Yann Pernot, Vi RetaultReinforcement LearningCredit Assignment in RL

  4. STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability

    Jun 17, 2026Haipeng Luo, Qingfeng Sun, Songli Wu +4RL for Language Model ReasoningMaximum Entropy RL

  5. GD2^2PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization

    Jun 15, 2026Haotian Liu, Yihao Liu, Jingwei Ni +11Multi-Objective Reinforcement LearningRL for Language Models

  6. A First-Principles Derivation of LLM Policy Optimization: From Expected Reward to GRPO and Its Structural Extensions

    Jun 15, 2026Jianghan Shen, Siqi Luo, Yue Li +9RL for Language ModelsGroup Relative Policy Optimization

  7. Proximal Policy Optimization for Amortized Discrete Sampling

    Jun 14, 2026Anna Zykova-Myzina, Timofei Gritsaev, Daniil Tiapkin +1Molecular Graph GenerationGenerative Flow Networks

  8. DiPOD: Diffusion Policy Optimization without Drifting Apart

    Jun 11, 2026Haozhe Jiang, Haiwen Feng, Pieter Abbeel +3Policy Gradient MethodsRL for Diffusion Models

  9. The Easy, the Hard, and the Learnable: Confidence and Difficulty-Adaptive Policy Optimization for LLM Reasoning

    Jun 6, 2026Zhanke Zhou, Xiangyu Lu, Chentao Cao +4RL for Language Model ReasoningPolicy Optimization

  10. Generative Modeling of Discrete Latent Structures via Dynamic Policy Gradients

    Jun 5, 2026Stefan Ivanovic, Ge Liu, Mohammed El-KebirLatent Variable ModelsPolicy Gradient Methods

  11. On Advantage Estimates for Max@K Policy Gradients

    Jun 4, 2026Shota Takashiro, Soichiro Nishimori, Paavo Parmas +6Policy GradientPolicy Gradient Methods

  12. Retry Policy Gradients in Continuous Action Spaces

    Jun 4, 2026Soichiro Nishimori, Paavo ParmasPolicy OptimizationRL Exploration

  13. When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training

    Jun 4, 2026Yuanfan Li, Qi Zhou, Wenjing Duan +1Credit Assignment in RLStep-Level Credit Assignment in RL

  14. Policy Gradient for Continuous-Time Robust Markov Decision Processes

    Jun 3, 2026Tanya Veeravalli, David M. Bossens, Atsushi NitandaRobust Markov Decision ProcessesMarkov Decision Processes

  15. Local Guidance, Global Impact: Gaussian-Reshaped Trust Region Unlocks Behavior Transitions

    Jun 2, 2026Bingxu Liu, Jiashun Liu, Johan Obando-Ceron +5Non-Stationary RLReinforcement Learning

  16. Self-Distilled Policy Gradient

    Jun 2, 2026Yifeng Liu, Shiyuan Zhang, Yifan Zhang +1Policy GradientOn-Policy Self-Distillation

  17. Task-Induced Representational Invariances Depend on Learning Objective in Deep RL

    Jun 1, 2026Manu Srinath Halvagal, Sebastian Lee, SueYeon ChungMarkov Decision ProcessesDeep Q-Learning

  18. Decision-Focused On-Policy Learning for Contextual Linear Optimization with Partial Feedback

    May 31, 2026Wyame Benslimane, Tinghan Ye, Pascal Van Hentenryck +1Predict-Then-OptimizeDecision-Focused Learning

  19. OPD+: Rethinking the Advantage Design for On-Policy Distillation

    May 31, 2026Hanyang Zhao, Haoxian Chen, Han Lin +3Language Model DistillationPolicy Gradient Methods

  20. Emergence of Exploration in Policy Gradient Reinforcement Learning via Retrying

    May 29, 2026Soichiro Nishimori, Paavo Parmas, Sotetsu Koyamada +4RL ExplorationPolicy Gradient Methods

  21. Guidance Contrastive Token Credit Assignment for Discrete Policy Optimization

    May 28, 2026Shufan Li, Konstantinos Kallidromitis, Akash Gokul +2Token-Level Credit AssignmentRL for Language Model Reasoning

  22. Modeling Vehicle-Type-Specific Pedestrian Crash Avoidance Behavior in Safety-Critical Interactions Using Smooth-Mamba Deep Reinforcement Learning

    May 27, 2026Qingwen Pu, Kun Xie, Hong Yang +2Collision AvoidancePedestrian Behavior Modeling

  23. BASIS: Batchwise Advantage Estimation from Single-Rollout Information Sharing for LLM Reasoning

    May 26, 2026Shijin Gong, Erhan Xu, Kai Ye +3RL for Language Model ReasoningCritic-Free RL

  24. Bilevel Optimization over Saddle Points of Zero-Sum Markov Games

    May 26, 2026Zihao Zheng, Irwin King, Songtao LuGame TheoryZero-Sum Games