Policy Learning

Momentum

79 papers in the last four weeks, up 316% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 416

All topics
CardsList
  1. StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning

    May 26, 2026Yanfei Zhang, Xu Lin, Chenglin WuCredit Assignment in RLStep-Level Credit Assignment in RL

  2. Completion vs Optimality: Policy Gradient in Long-Horizon Cumulative-Damage Problems

    May 26, 2026Wolfgang Maass, Sabine JanzenPolicy GradientProximal Policy Optimization

  3. Credit Assignment with Resets in Language Model Reasoning

    May 25, 2026Ankur Samanta, Akshayaa Magesh, Ayush Jain +7RL for Language Model ReasoningCredit Assignment in RL

  4. Not only where, But when: Temporal Scheduling for RLVR

    May 25, 2026Jinghao Zhang, Ruilin Li, Feng Zhao +1RL for Language Model ReasoningCredit Assignment in RL

  5. Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation

    May 25, 2026Junwei Zhou, Yu-Wing Tai3D Spatial Reasoning3D Scene Layout Generation

  6. Active Learning for Stochastic Contextual Linear Bandits

    May 24, 2026Emma Brunskill, Ishani Karmarkar, Zhaoqi LiActive LearningAdaptive Sampling

  7. How Neural Reward Models Learn Features for Policy Optimization: A Single-Index Analysis

    May 23, 2026Rei Higuchi, Ryotaro Kawata, Akifumi Wachi +3Reward ModelingRepresentation Learning

  8. ECHO: Terminal Agents Learn World Models for Free

    May 23, 2026Vaishnavi Shrivastava, Piero Kauffmann, Ahmed Awadallah +1World Model LearningComputer-Use Agents

  9. Learning Kernel-Based MDPs from Episodic Preferential Feedback

    May 22, 2026Nikola Pavlovic, Sattar Vakili, Qing ZhaoPairwise Preference LearningRegret Minimization in RL

  10. Goal-Conditioned Agents that Learn Everything All at Once

    May 22, 2026Michael Matthews, Matthew Jackson, Michael Beukman +5Policy LearningSample-Efficient RL

  11. From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning

    May 22, 2026Ranxu zhang, zeyang li, Jiacheng Huang +5Agentic RLReinforcement Learning

  12. Vector Policy Optimization: Training for Diversity Improves Test-Time Search

    May 21, 2026Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld +6Multi-Objective Reinforcement LearningReinforcement Learning

  13. Abstraction for Offline Goal-Conditioned Reinforcement Learning

    May 21, 2026Clarisse Wibault, Alexander Goldie, Antonio Villares +2Hierarchical RLState Abstraction

  14. Factored Diffusion Policies:Compositionally Generalized Robot Control with a Single Score Network

    May 21, 2026Sayan Mitra, Ege Yuceel, Noah Giles +1Robotic ControlDiffusion Policy

  15. Chebyshev Policies and the Mountain Car Problem: Reinforcement Learning for Low-Dimensional Control Tasks

    May 21, 2026Stefan Huber, Hannes Unger, Georg Schäfer +1RL ControlPolicy Optimization

  16. OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning

    May 21, 2026Yu Li, Rui Miao, Tian Lan +1Value Function EstimationToken-Level Credit Assignment

  17. Behavior-Consistent Deep Reinforcement Learning

    May 20, 2026Marcel Hussing, Liv G. d'Aliberti, Claas Voelcker +2Reinforcement LearningPolicy Optimization

  18. Beyond the Bellman Recursion: A Pontryagin-Guided Framework for Non-Exponential Discounting

    May 20, 2026Hojin Ko, Jeonggyu HuhReinforcement LearningStochastic Optimal Control

  19. DISC: Decoupling Instruction from State-Conditioned Control via Policy Generation

    May 20, 2026Hanxiang Ren, Pei Zhou, Xunzhe Zhou +1Language-Conditioned Robot ManipulationVisuomotor Policy Learning

  20. AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback

    May 20, 2026Miaobo Hu, Shuhao Hu, Bokun Wang +5RL for Language Model ReasoningGroup Relative Policy Optimization

  21. Jointly Learning Predicates and Actions Enables Zero-Shot Skill Composition

    May 20, 2026Benedict Quartey, Sebastian Castro, Eric Rosen +3Robot Skill LearningGeneralization in Robotic Manipulation

  22. Learning to Hand Off: Provably Convergent Workflow Learning under Interface Constraints

    May 18, 2026Jiayu Li, Enpei Zhang, Dawei Zhou +2Sequential MARLSequential Decision Making

  23. General Preference Reinforcement Learning

    May 18, 2026Muhammad Umer, Muhammad Ahmed Mohsin, Ahsan Bilal +5Multi-Objective Language Model AlignmentRL Fine-Tuning

  24. Unified Walking, Running, and Recovery for Humanoids via State-Dependent Adversarial Motion Priors

    May 18, 2026Yidan Lu, Yichao Zhong, Liu Zhao +2Humanoid Robot LocomotionRobot Failure Recovery

  25. FLASH: Efficient Visuomotor Policy via Sparse Sampling

    May 15, 2026Jiaqi Bai, Jindou Jia, Yuxuan Hu +5Flow MatchingLong-Horizon Robotic Manipulation

  26. Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy

    May 14, 2026Langzhou He, Junyou Zhu, Yue Zhou +7Agentic RLToken-Level Credit Assignment

  27. Collaborative Yet Personalized Policy Training: Single-Timescale Federated Actor-Critic

    May 14, 2026Leo Muxing Wang, Pengkun Yang, Lili SuFederated RLActor-Critic Methods