Policy Learning

Momentum

79 papers in the last four weeks, up 316% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 416

All topics
CardsList
  1. Dynamic Latent Routing

    May 14, 2026Fangyuan Yu, Xin Su, Amir AbdullahLatent Action LearningRL Post-Training

  2. Tight Sample Complexity Bounds for Entropic Best Policy Identification

    May 13, 2026Amer Essakine, Claire VernadeReinforcement LearningRisk-Sensitive RL

  3. Achieving ε−2ε^{-2} Sample Complexity for Single-Loop Actor-Critic under Minimal Assumptions

    May 13, 2026Ishaq Hamza, Zaiwei ChenPolicy GradientLast-Iterate Convergence

  4. GAGPO: Generalized Advantage Grouped Policy Optimization

    May 13, 2026Siyuan Zhu, Chao Yu, Rongxin Yang +4Reinforcement LearningGroup Relative Policy Optimization

  5. ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization

    May 12, 2026Nirmal Patel, Fei Wang, Inderjit S. DhillonRL for Language ModelsReinforcement Learning

  6. TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

    May 12, 2026Matthew M. Hong, Jesse Zhang, Anusha Nagabandi +1Robot Policy AdaptationRobot Skill Learning

  7. Learning Agentic Policy from Action Guidance

    May 12, 2026Yuxiang Ji, Zengbin Wang, Yong Wang +6Agentic RLReinforcement Learning

  8. Delightful Gradients Accelerate Corner Escape

    May 12, 2026Jincheng Mei, Ian OsbandMulti-Armed BanditsPolicy Gradient

  9. GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation

    May 12, 2026Sijia Li, Yuchen Huang, Zifan Liu +7RL for Language Model ReasoningCredit Assignment in RL

  10. Selective Off-Policy Reference Tuning with Plan Guidance

    May 12, 2026Duc Anh Le, Tien-Phat Nguyen, Thien Huu Nguyen +2Reinforcement LearningRL for Language Model Reasoning

  11. Metric-Gradient Projection for Stable Multi-Agent Policy Learning

    May 12, 2026Zuyuan Zhang, Sizhe Tang, Mahdi Imani +1Hodge DecompositionMulti-Agent Systems

  12. Learning When to Act: Communication-Efficient Reinforcement Learning via Run-Time Assurance

    May 11, 2026Adam Haroon, Erick J. Rodríguez-Seda, Cody Fleming +1RL ControlLyapunov-Based Control

  13. Revisiting Policy Gradients for Restricted Policy Classes: Escaping Myopic Local Optima with kk-step Policy Gradients

    May 11, 2026Alex DeWeese, Guannan QuPolicy GradientPolicy Optimization

  14. Policy Gradient Methods for Non-Markovian Reinforcement Learning

    May 11, 2026Avik Kar, Siddharth Chandak, Rahul Singh +4Reinforcement LearningPolicy Gradient Methods

  15. Natural Policy Gradient as Doubly Smoothed Policy Iteration: A Bellman-Operator Framework

    May 11, 2026Phalguni Nanda, Zaiwei ChenPolicy GradientReinforcement Learning

  16. Trust Region Inverse Reinforcement Learning: Explicit Dual Ascent using Local Policy Updates

    May 10, 2026Anish Diwan, Davide Tateo, Christopher E. Mower +3Reinforcement LearningPolicy Optimization

  17. Neuromorphic Reinforcement Learning for Quadruped Locomotion Control on Uneven Terrain

    May 10, 2026Zhuangyu Han, Abhronil SenguptaEquilibrium PropagationTerrain-Aware Robot Locomotion

  18. Revisiting Mixture Policies in Entropy-Regularized Actor-Critic

    May 9, 2026Jiamin He, Samuel Neumann, Jincheng Mei +2RL ControlPolicy Optimization

  19. A Single Deep Preference-Conditioned Policy for Learning Pareto Coverage Sets

    May 9, 2026Akihiro Kubo, Kosuke Nakanishi, Shin IshiiMulti-Objective Reinforcement LearningPolicy Optimization

  20. The Reciprocity Gradient

    May 8, 2026Yue Lin, Pascal Poupart, Shuhui Zhu +5Credit Assignment in RLPolicy Gradient Methods

  21. KL for a KL: On-Policy Distillation with Control Variate Baseline

    May 8, 2026Minjae Oh, Sangjun Song, Gyubin Choi +2Language Model DistillationPolicy Gradient Methods

  22. Reflective Prompted Policy Optimization: Trajectory-Grounded Revision and Salience Bias

    May 8, 2026Rahaf Abu Hara, Vaibbhav Murarri, Claudio ZitoPolicy OptimizationLLM-Guided RL

  23. Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States

    May 8, 2026Yunho Choi, Jongwon Lim, Woojin Ahn +3Value Function EstimationRL for Language Model Reasoning