Policy Learning

Momentum

79 papers in the last four weeks, up 316% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 416

All topics
CardsList
  1. Exploration and Online Transfer with Behavioral Foundation Models

    Jun 29, 2026Louis Bagot, Mathieu Lefort, Laëtitia MatignonReinforcement LearningRL Exploration

  2. STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning

    Jun 29, 2026Zhihao Liu, Qiuyi Gu, Yitao Wang +16Robot Policy LearningRobot Skill Learning

  3. Behavior Uncloning: Distilling Mode Redirection into Policy Weights without Inference-Time Steering

    Jun 28, 2026Hao Wang, Jiuzhou Lei, Dayou Li +5Robot Policy LearningRobot Policy Adaptation

  4. Regularized Reward-Punishment Reinforcement Learning

    Jun 26, 2026Jiexin Wang, Eiji UchibeReinforcement LearningKL-Regularized RL

  5. Continual Robot Policy Learning via Variational Neural Dynamics

    Jun 25, 2026Jiaxu Xing, Zhiyuan Zhu, Yunfan Ren +4Robot Policy LearningRobot Policy Adaptation

  6. Automating Potential-based Reward Shaping with Vision Language Model Guidance

    Jun 25, 2026Henrik Müller, Daniel KudenkoReward ShapingSparse-Reward RL

  7. OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning

    Jun 25, 2026Shuo Yang, Jinyang Wu, Zhengxi Lu +8Agentic RLLLM Agent Skill Learning

  8. Finding the Time to Think: Learning Planning Budgets in Real-Time RL

    Jun 24, 2026Aneesh Muppidi, Firas Darwish, Dylan Cope +2Reinforcement LearningPolicy Learning

  9. Memory-Efficient Policy Libraries with Low-Rank Adaptation in Reinforcement Learning

    Jun 24, 2026Samuel Valland Lyngset, Tor Viljen Raanaas, Gard Sveipe +4RL for RoboticsLow-Rank Adaptation

  10. Low-Complexity Policy Tessellations in Structured Markov Decision Processes

    Jun 24, 2026Fredy PokouMarkov Decision ProcessesReinforcement Learning

  11. MAPL: Multi-Objective Preference Learning for Robot Locomotion

    Jun 24, 2026Xiyue Chen, Muhan Lin, Shuyang Shi +1Multi-Objective Reinforcement LearningReward Modeling

  12. Efficient Adaptive Data Acquisition via Pretrained Belief Representations

    Jun 23, 2026Daolang Huang, Zhuoyue Huang, Conor Hassan +3Bayesian OptimizationActive Learning

  13. Minimax PAC Bounds for Learning in Exogenous Contextual MDPs

    Jun 23, 2026Corentin Pla, Hugo Richard, Marc Abeille +1Markov Decision ProcessesReinforcement Learning

  14. Bias-Controlled Primal-Dual Natural Actor-Critic: Optimal Rates for Constrained Multi-Objective Average-Reward RL

    Jun 23, 2026Ankur Naskar, Swetha Ganesh, Vaneet AggarwalMulti-Objective Reinforcement LearningReinforcement Learning

  15. ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning

    Jun 23, 2026Wenyang Hu, Junxiang Jia, Zhen Shu +3RL for Language ModelsRL for Language Model Reasoning

  16. LaGO: Latent Action Guidance for Online Reinforcement Learning

    Jun 23, 2026Kuan-Yen Liu, Ren-Jyun Huang, Ti-Rong WuLatent Action LearningLLM-Guided RL

  17. EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games

    Jun 22, 2026Tristan Maidment, JB Lanier, Chase McDonald +5Self-Play RLImperfect-Information Games

  18. KLip-PPO: A per-sample KL perspective on PPO-Clip

    Jun 22, 2026Riccardo Colletti, Robin HolzingerKL-Regularized RLPolicy Gradient Methods

  19. On the Position Bias of On-Policy Distillation

    Jun 21, 2026Yan Xie, Sijie Zhu, Tiansheng Wen +2Importance WeightingLanguage Model Distillation

  20. Drowning in Routine: Signal Dilution in Multi-Turn Agent Training

    Jun 20, 2026Yann Pernot, Vi RetaultReinforcement LearningCredit Assignment in RL

  21. Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

    Jun 20, 2026Zhao Yang, Yuxuan Jiang, Ting-Chih Chen +18RL for Language ModelsCredit Assignment in RL

  22. Pareto Q-Learning with Reward Machines

    Jun 17, 2026Arnaud Lequen, Clément Legrand-Lixon, Léo SaulièresMulti-Objective Reinforcement LearningReinforcement Learning

  23. From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning

    Jun 16, 2026Chao Chen, Chengzu Li, Zhiwei Li +2Reinforcement LearningLLM-Guided RL

  24. EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning

    Jun 16, 2026Zhitong Wang, Songze Li, Hao Peng +4Agentic RLWorld Model Learning