Policy Learning

Momentum

79 papers in the last four weeks, up 316% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 416

All topics
CardsList
  1. Group Adaptive Clipping Policy Optimization

    Aug 31, 2026Sheng Jia, Xiao Wang, Shiva Prasad Kasiviswanathan +1Group Relative Policy OptimizationPolicy Optimization

  2. PAVE: Predictive Alignment and Value-Guided Evolution for World-Action Policies

    Aug 31, 2026Botong Zhao, Fang Yu, Tim Yu +3Robot Policy LearningRobot Skill Learning

  3. How do World Models and Policies Compose in LLM Agents? A Joint Spectral and Behavioral Account

    Aug 30, 2026Ruize Xu, Xiao Yu, Yujin Tang +2World Model LearningWorld Models

  4. Harness-RL: Black-Box Reinforcement Learning with Action-Args Decoupling for Central-Agent Multi-Agent Harnesses

    Aug 30, 2026Xinke Jiang, Zhixin Zhang, Zhibang Yang +6Multi-Agent LLM SystemsAgent Harness Optimization

  5. Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning

    Aug 13, 2026Yao Zhou, Hang Gao, Fengge Wu +2Group Relative Policy OptimizationStep-Level Credit Assignment in RL

  6. Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents

    Aug 13, 2026Haoze Wu, Chuqiao Kuang, Tianyi Zhuang +1Group Relative Policy OptimizationCredit Assignment in RL

  7. Let it Cook: Learning to Wait in Sequential Decision Making

    Aug 11, 2026Christopher Watson, Arjun Krishna, Dinesh Jayaraman +1Sequential Decision MakingLearning to Defer

  8. Boundary-Seeking Policy Gradient for Safe Reinforcement Learning

    Aug 10, 2026Chenhua Fan, Jiahui Zhu, Yuhang Zhang +1Markov Decision ProcessesConstrained RL

  9. Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning

    Aug 7, 2026Haoyu Zheng, Yun Zhu, Qing Wang +1Agentic RLCredit Assignment in RL

  10. Learning Suffers More Than the Policy Class Under Partial Observability: A Closed-Form Analysis

    Aug 7, 2026Idil GözelRL ControlReinforcement Learning

  11. How Much, Then Where: Credit-Conserving Action-to-Token Allocation for Multi-Turn Agent Reinforcement Learning

    Aug 7, 2026Lichao Ma, Yang Sun, Shuaitao Zhao +9Token-Level Credit AssignmentCredit Assignment in RL

  12. Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents

    Aug 7, 2026Hongxi Yan, Ziyue Huang, Shichao Fan +1Credit Assignment in RLStep-Level Credit Assignment in RL

  13. AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

    Aug 6, 2026Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao +10Agentic RLReinforcement Learning

  14. Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control

    Aug 5, 2026Rohit Kumar Salla, Manoj Saravanan, Simon StepputtisDiffusion PolicyContinuous Control

  15. Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning

    Aug 5, 2026Zheyuan Zhang, Manqing Mao, Hong Wang +8RL for Language ModelsRL Post-Training

  16. Exact Model-Free Policy Iteration for Co-safe LTL Planning

    Aug 5, 2026Zetong Xuan, Yu WangReinforcement LearningPolicy Iteration

  17. Unified Visuomotor Targets: Supervising VLAs Beyond Physical Actions

    Aug 4, 2026Zhenyang Feng, Unnat JainLatent Action LearningVisuomotor Policy Learning

  18. SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling

    Aug 3, 2026Evan Assmus, Qining Zhang, Lei YingReinforcement LearningRobotic RL

  19. Improved Quantum Algorithms for Reinforcement Learning Under a Generative Model

    Aug 3, 2026Joao F. DoriguelloMarkov Decision ProcessesReinforcement Learning

  20. Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy

    Aug 3, 2026Jim Dilkes, Vahid Yazdanpanah, Sebastian SteinRL for Language Model ReasoningRL Post-Training