Policy Learning

Momentum

79 papers in the last four weeks, up 316% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 416

All topics
CardsList
  1. HindSearch: Trajectory-Level Hindsight Critique for Search-Augmented Reinforcement Learning

    Aug 3, 2026Haowei Liu, Jiamian Wang, Hsin-Tai Wu +2RL for Language ModelsAgentic Search

  2. Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning

    Aug 2, 2026Wenhao Zhang, Yibo Xie, Rui Wang +9Reinforcement LearningRL for Language Model Reasoning

  3. ReBRAC-v2: The Return of the King

    Aug 2, 2026Denis Tarasov, Robert K. KatzschmannReinforcement LearningOffline RL

  4. Learning Not to Optimize: Physics-Informed Action-Space Reshaping for Intent-Based Network Control

    Aug 2, 2026Zuyuan Zhang, Vaneet Aggarwal, Tian LanReinforcement LearningPolicy Optimization

  5. Personalizing Large Language Model Agents with Small Policy Models

    Jul 31, 2026Dian Jin, Zhi Zhang, Huichao Li +3LLM PersonalizationLLM Agents

  6. Convergence and Regret of the Policy Gradient for Multi-Armed Bandits in Diffusion Environment

    Jul 31, 2026Yanwei Jia, Du OuyangMulti-Armed BanditsRegret Minimization in RL

  7. Temporal Policy: History-Initialized Action Generation for Robotic Learning from Demonstration

    Jul 31, 2026Dylan Miller, Martin JagersandFlow MatchingRobot Policy Learning

  8. Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification

    Jul 31, 2026Anders Jonsson, Emilie Kaufmann, Gianmarco Tedeschi +1Hierarchical RLPolicy Learning

  9. Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL

    Jul 31, 2026Ruiming Liang, Yi Zhong, Yizhen Yuan +6Multi-Objective Reinforcement LearningRL for Language Models

  10. ββ-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

    Jul 30, 2026Jiawei Xu, Minghui Liu, Juzheng Zhang +2KL-Regularized RLOn-Policy Self-Distillation

  11. On-Policy and Off-Policy Learning for Large Action Spaces

    Jul 30, 2026Imad AoualiThompson SamplingMulti-Armed Bandits

  12. Hierarchical Multilevel Monte Carlo for Order-Optimal Neural Actor-Critic in Average-Reward CMDPs

    Jul 30, 2026Ankur Naskar, Vaneet AggarwalAverage-Reward RLConstrained RL

  13. Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?

    Jul 29, 2026Perry Dong, Ron Polonsky, Dorsa Sadigh +1Continuous ControlRL Fine-Tuning

  14. Pass the Baton: Trajectory-Relayed On-Policy Distillation

    Jul 28, 2026Haolei Xu, Xiaowen Xu, Haiwen Hong +5Language Model DistillationOn-Policy Distillation

  15. πR2π\mathbf{R}^2: Reactive Real-time Flow Policies

    Jul 28, 2026Sungjae Park, Shubham TulsianiRobotic ControlFlow Matching

  16. PAC-DP: PAC-Bayesian Diffusion Policy Learning

    Jul 27, 2026Mohammad Hasan Yeganegi, Dian Yu, Andrea Del Prete +2PAC-Bayesian Generalization BoundsRobot Policy Learning

  17. Finite-Time Analysis of the Natural Policy Gradient in Finite-Horizon Markov Decision Processes

    Jul 25, 2026Asha Barua, Sajad KhodadadianPolicy GradientMarkov Decision Processes

  18. PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning

    Jul 23, 2026Yipeng Shi, Zhipeng Ma, Yue Wang +4Agentic RLLLM Agent Skill Learning

  19. Relative Value Learning

    Jul 23, 2026Marc Höftmann, Jan Robine, Stefan HarmelingValue Function EstimationTemporal-Difference Learning

  20. AttriMem: Attribution-Guided Process Feedback for Agent Memory Construction

    Jul 23, 2026Qinfeng Li, Yuntai Bao, Xinyan Yu +7LLM Agent MemoryPolicy Learning

  21. Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks

    Jul 22, 2026Kaibing Yang, Guangfeng Cai, Shengtian Yang +6Group Relative Policy OptimizationRL Exploration

  22. From Trajectories to Instructions: Language-Conditioned Meta-Reinforcement Learning

    Jul 21, 2026Garvit Singla, Uma Maheswari Natarajan, Raghuram Bharadwaj DiddigiReinforcement LearningMeta-Learning

  23. OR Else: A Differentiable Trust Region for Policy Optimization

    Jul 20, 2026Chinmay Rane, Kanishka Tyagi, Michael ManryRL for Language ModelsGroup Relative Policy Optimization

  24. Theoretical Foundations of max⁡\max@kk Reinforcement Learning

    Jul 20, 2026Riccardo Poiani, Martino Bernasconi, Andrea CelliReinforcement LearningPolicy Learning