Policy Learning

Momentum

79 papers in the last four weeks, up 316% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 416

All topics
CardsList
  1. SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter

    Jun 4, 2026Powei Chang, Jinpeng Zhang, Chaoqun Sun +6Policy GradientGroup Relative Policy Optimization

  2. Agentic Monte Carlo: Simulating Reinforcement Learning for Black-Box Agents

    Jun 3, 2026Dae Yon Hwang, Raunaq Suri, Valentin Villecroze +4Reinforcement LearningBayesian RL

  3. Reinforcement Learning from Rich Feedback with Distributional DAgger

    Jun 3, 2026Rishabh Agrawal, Jacob Fein-Ashley, Paria RashidinejadDistributional RLRL for Language Model Reasoning

  4. SocraticPO: Policy Optimization via Interactive Guidance

    Jun 3, 2026Zirui Liu, Jie Ouyang, Qi Liu +8RL for Language Model ReasoningLLM-Guided RL

  5. Rollout-Level Advantage-Prioritized Experience Replay for GRPO

    Jun 3, 2026Gyeongtae Yoo, Sanghyeok Park, Soohyuk Jang +2RL for Language Model ReasoningGroup Relative Policy Optimization

  6. Policy Gradient for Continuous-Time Robust Markov Decision Processes

    Jun 3, 2026Tanya Veeravalli, David M. Bossens, Atsushi NitandaRobust Markov Decision ProcessesMarkov Decision Processes

  7. Policy-based Foveated Imaging and Perception

    Jun 1, 2026Howard Xiao, Jan Ackermann, Boyang Deng +1Active PerceptionPolicy Learning

  8. Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards

    Jun 1, 2026Christian Scherer, Joe Watson, Theo Gruner +3Reinforcement LearningRobot Skill Learning

  9. World-Task Factorization for Robot Learning

    Jun 1, 2026Eduardo Sebastián, Adrian Pfisterer, Vito Mengers +2Robotic ControlRobot Policy Learning

  10. Training-Free Imitation Learning with Closed-Form Diffusion Policies

    May 31, 2026Raghav Mishra, Ian R. ManchesterDiffusion Model GuidanceVisuomotor Policy Learning

  11. Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies

    May 31, 2026Hikmet Simsir, Ozgur S. OguzRobot Policy AdaptationReinforcement Learning

  12. Decision-Focused On-Policy Learning for Contextual Linear Optimization with Partial Feedback

    May 31, 2026Wyame Benslimane, Tinghan Ye, Pascal Van Hentenryck +1Predict-Then-OptimizeDecision-Focused Learning

  13. Decoupled Behavioral Cloning for Scalable Inductive Generalization in RL from Specifications

    May 30, 2026Vignesh Subramanian, Subhajit Roy, Suguman BansalReinforcement LearningMeta-Reinforcement Learning

  14. Drift Q-Learning

    May 29, 2026Anas Houssaini, Mohamad H. Danesh, Amin Abyaneh +3Reinforcement LearningQ-Learning

  15. From Noise to Control: Parameterized Diffusion Policies

    May 29, 2026Renhao Zhang, Haotian Fu, Mingxi Jia +3Robot Policy LearningRobot Policy Adaptation

  16. Skill Reuse as Compression in Agentic RL

    May 29, 2026Zhikun Xu, Yu Feng, Jacob Dineen +3Agentic RLMinimum Description Length

  17. Agentic Transformers Provably Learn to Search via Reinforcement Learning

    May 29, 2026Tong Yang, Yu Huang, Yingbin Liang +1Policy GradientAgentic RL

  18. Trust-Region Behavior Blending for On-Policy Distillation

    May 29, 2026Daniil Plyusov, Alexey Gorbatovski, Alexey Malakhov +4Language Model DistillationTrust-Region Optimization

  19. Safe Equilibrium Policy Optimization for Strategic Agent Policies

    May 29, 2026Karthika Arumugam, Kiran Kumar Manku, Amit DhandaMulti-Agent System OptimizationGame-Playing Agents

  20. Emergence of Exploration in Policy Gradient Reinforcement Learning via Retrying

    May 29, 2026Soichiro Nishimori, Paavo Parmas, Sotetsu Koyamada +4RL ExplorationPolicy Gradient Methods

  21. FLAG: Flow Policy MaxEnt-RL by Latent Augmented Guidance

    May 29, 2026Sungha Kim, Gawon Lee, Jusuk Lee +3RL ControlMaximum Entropy RL

  22. When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?

    May 29, 2026Stephane Hatgis-Kessell, Emma BrunskillLanguage Model-Based ControlPolicy Optimization

  23. HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime

    May 28, 2026Mohamed Sana, Nicola Piovesan, Antonio De Domenico +2Group Relative Policy OptimizationPolicy Optimization

  24. ESPO: Early-Stopping Proximal Policy Optimization

    May 28, 2026Zihang Li, Rui Zhou, Yingcheng Shi +8Early StoppingReinforcement Learning

  25. Variance-Adaptive Optimal Algorithm for Reinforcement Learning with Multinomial Logit Function Approximation

    May 27, 2026Wonyoung Kim, Min-Hwan Oh, Garud Iyengar +1Regret Minimization in RLReinforcement Learning

  26. Commit to the Bit: Reactive Reinforcement Learning Done Right

    May 27, 2026Onno Eberhard, Claire Vernade, Michael MuehlebachReinforcement LearningPartially Observable RL

  27. Off-Policy Learning to Reason Works Because It Is More Pessimistic Than You Think

    May 27, 2026Otmane Sakhi, Aleksei Arzhantsev, Imad Aouali +1Reinforcement LearningRL for Language Model Reasoning

  28. Learning to Assign Prediction Tasks to Agents with Capacity Constraints

    May 27, 2026Shang Wu, Saatvik Kher, Padhraic SmythLearning to DeferContextual Bandits

  29. SPAR: Support-Preserving Action Rectification

    May 27, 2026Jiaxin Zhao, Weihang Pan, Xun Liang +1Imitation LearningOffline RL

  30. BASIS: Batchwise Advantage Estimation from Single-Rollout Information Sharing for LLM Reasoning

    May 26, 2026Shijin Gong, Erhan Xu, Kai Ye +3RL for Language Model ReasoningCritic-Free RL