Policy Learning

Momentum

79 papers in the last four weeks, up 316% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 416

All topics
CardsList
  1. Rethinking the Suitability of Reinforcement Learning Algorithms Under Practical Transfer Constraints

    Jul 19, 2026Hany Hamed, Abhishek Naik, Colin Bellinger +1Domain RandomizationReinforcement Learning

  2. When to Plan: Learning to Select Between Reactive Control and Deliberative Planning

    Jul 17, 2026Adam Labiosa, Josiah P. HannaRobot Policy LearningRobotic RL

  3. Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning

    Jul 15, 2026Bowei He, Yankai Chen, Xiaokun Zhang +1Reinforcement LearningPolicy Gradient Methods

  4. Environment Parameter Gradient Theorem for Policy-Environment Co-Design in Reinforcement Learning

    Jul 14, 2026Amber SrivastavaPolicy Learning

  5. Learning to Navigate with Minimal Parameters: Decomposing Visual Navigation Through Closed-Form Geometric Interfaces

    Jul 13, 2026Edward Beng Wai Tan, Siew-Kei LamVisual NavigationRobot Policy Learning

  6. Actor-Critic Learning for Extended Mean Field Control with Deterministic Policies

    Jul 13, 2026Ziheng Cheng, Xin Guo, Huyên Pham +1Policy GradientContinuous-Time RL

  7. SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions

    Jul 9, 2026Elham Daneshmand, Majid Khadiv, Glen Berseth +1Robot SafetyProximal Policy Optimization

  8. Prompt-Driven Exploration

    Jul 9, 2026Sunshine Jiang, John Marangola, David Zhang +6LLM-Guided RLRL Exploration

  9. Latent Memory Palace: Reasoning for Control as Autoregressive Variational Inference

    Jul 9, 2026Chuning Zhu, Eva Xu, Jose Barreiros +3RL ControlLatent Action Learning

  10. Expressivity and Statistical Trade-offs in Diffusion Policy Learning

    Jul 8, 2026Viet Vu, Renyuan Xu, Jiacheng Zhang +1Diffusion PolicyRL for Diffusion Models

  11. NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL

    Jul 8, 2026Erdemt Bao, Xing Lei, Jun Chen +2Normalizing FlowsHierarchical RL

  12. Optimal Transport Q-Learning for Flow Policy Steering and Acceleration

    Jul 7, 2026Andreas Sochopoulos, Esmeralda S. Whitammer, Nikolaos Tsagkas +3Robot Policy AdaptationQ-Learning

  13. Weak-to-Strong Generalization via Direct On-Policy Distillation

    Jul 6, 2026Shiyuan Feng, Huan-ang Gao, Haohan Chi +7RL for Language Model ReasoningWeak-to-Strong Generalization

  14. TREK: Distill to Explore, Reinforce to Refine

    Jul 6, 2026Yuanda Xu, Zhengze Zhou, Kayhan Behdin +10RL for Language Model ReasoningLLM-Guided RL

  15. Multi-Turn On-Policy Distillation with Prefix Replay

    Jul 6, 2026Baohao Liao, Hanze Dong, Christof Monz +3LLM Agent TrainingOn-Policy Distillation

  16. Trust Region Policy Distillation

    Jul 6, 2026Zhengpeng Xie, Li Lyna Zhang, Zeke Xie +1On-Policy DistillationPolicy Learning

  17. A Hierarchy of Policy Learning Problems

    Jul 3, 2026Hamsa Bastani, Osbert Bastani, Shihan ChenSample ComplexityOffline RL

  18. ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy

    Jul 3, 2026Zijun Xie, Yuyang You, Yongzhi Li +6Token-Level Credit AssignmentRL for Language Model Reasoning

  19. ASK in the Dark: Uncertainty-Gated LLM Assistance under Partial Observability

    Jul 2, 2026Juarez Monteiro, Nathan Gavenski, Guilherme Lima +3Partially Observable RLLLM Prompting

  20. Learning Agile Intruder Interception using Differentiable Quadrotor Dynamics

    Jul 2, 2026Michael Anoruo, Xiaoyu Tian, Abhishek Rathod +5RL ControlRobot Policy Learning

  21. Mean Field Reinforcement Learning

    Jul 1, 2026René Carmona, Mathieu LaurièreReinforcement LearningQ-Learning

  22. Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL

    Jul 1, 2026Juliette Decugis, Sean O'Brien, Francis Bach +2Policy GradientRL for Language Model Reasoning

  23. Learning Gait-Aware Quadruped Locomotion with Temporal Logic Specifications

    Jul 1, 2026Merve Atasever, Cagan Bakirci, Alfredo Reina Corona +2Reinforcement LearningRobot Skill Learning

  24. Freeform Preference Learning for Robotic Manipulation

    Jun 30, 2026Marcel Torne, Anubha Mahajan, Abhijnya Bhat +1Long-Horizon Robotic ManipulationRobot Skill Learning

  25. TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

    Jun 30, 2026Yuanda Xu, Zhengze Zhou, Hejian Sang +6Agentic RLStep-Level Credit Assignment in RL

  26. HyPOLE: Hyperproperty-Guided Multi-Agent Reinforcement Learning under Partial Observation

    Jun 29, 2026Arshia Rafieioskouei, Tzu-Han Hsu, Matthew Lucas +1Reinforcement LearningPartially Observable RL

  27. Predictable GRPO: A Closed-Form Model of Training Dynamics

    Jun 29, 2026Rajat Ghosh, Datta Nimmaturi, Aryan Singhal +4Group Relative Policy OptimizationPolicy Optimization

  28. ACPO: Agent-Chained Policy Optimization for Multi-Agent Reinforcement Learning

    Jun 29, 2026Daiki E. Matsunaga, Junho Na, Tri Wahyu Guntara +4Multi-Agent System OptimizationMulti-Agent Coordination