Policy Learning

Momentum

79 papers in the last four weeks, up 316% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 416

All topics
CardsList
  1. Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level

    May 7, 2026Nan Jia, Haojin Yang, Xing Ma +6RL for Language Model ReasoningLanguage Model Distillation

  2. On Training in Imagination

    May 7, 2026Nadav Timor, Ravid Shwartz-Ziv, Micah Goldblum +2Reward ModelingReinforcement Learning

  3. Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning

    May 7, 2026Yaorui Shi, Yuxin Chen, Zhengxi Lu +6LLM Agent Skill LearningLLM Agent Skill Retrieval

  4. Milestone-Guided Policy Learning for Long-Horizon Language Agents

    May 7, 2026Zixuan Wang, Yuchen Yan, Hongxing Li +7Credit Assignment in RLLong-Horizon Agent Tasks

  5. Transformers Provably Implement In-Context Reinforcement Learning with Policy Improvement

    May 7, 2026Haodong Liang, Lifeng LaiReinforcement LearningTransformer-Based RL

  6. Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning

    May 7, 2026Nandiraju Gireesh, Yuanliang Ju, He WangQ-LearningOffline RL

  7. Non-Myopic Active Feature Acquisition via Pathwise Policy Gradients

    May 6, 2026Linus Aronsson, Morteza Haghir ChehreghaniPolicy GradientActive Learning

  8. Approximate Next Policy Sampling: Replacing Conservative Target Policy Updates in Deep RL

    May 6, 2026Dillon Sandhu, Ronald ParrPolicy OptimizationPolicy Iteration

  9. LANTERN: LLM-Augmented Neurosymbolic Transfer with Experience-Gated Reasoning Networks

    May 6, 2026Mahyar Alinejad, Yue Wang, Amrit Singh Bedi +1Reinforcement LearningLLM-Guided RL

  10. Hidden States as Value Gradients: The Pontryagin Structure of Recurrent Policies

    May 6, 2026David Leeftink, Max Hinne, Marcel van GervenRL ControlReinforcement Learning

  11. On-line Learning in Tree MDPs by Treating Policies as Bandit Arms

    May 6, 2026Anvay Shah, Ramsundar Anandanarayanan, Sharayu Moharir +1Markov Decision ProcessesMarkov Models

  12. SPHERE: Mitigating the Loss of Spectral Plasticity in Mixture-of-Experts for Deep Reinforcement Learning

    May 6, 2026Lirui Luo, Guoxi Zhang, Hongming Xu +2Loss of PlasticityReinforcement Learning

  13. Hierarchical Support Vector State Partitioning for Distilling Black Box Reinforcement Learning Policies

    May 5, 2026Senne Deproost, Mehrdad Asadi, Ann NowéReinforcement LearningInterpretability in RL

  14. Vanishing L2 regularization for the softmax Multi Armed Bandit

    May 5, 2026Stefana-Lucia Anita, Gabriel TuriniciMulti-Armed BanditsPolicy Gradient

  15. T2^2PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning

    May 4, 2026Haixin Wang, Hejie Cui, Chenwei Zhang +7Agentic RLReinforcement Learning

  16. Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning

    May 3, 2026Sungyoung Lee, Dohyeong Kim, Eshan Balachandar +2Distributional RLQ-Learning

  17. Breaking the Computational Barrier: Provably Efficient Actor-Critic for Low-Rank MDPs

    May 2, 2026Ruiquan Huang, Donghao Li, Yingbin Liang +1Markov Decision ProcessesReinforcement Learning

  18. Data Deletion Can Help in Adaptive RL

    Apr 30, 2026Param Budhraja, Aditya Gangrade, Alex Olshevsky +1Non-Stationary RLReinforcement Learning

  19. Can Tabular Foundation Models Guide Exploration in Robot Policy Learning?

    Apr 30, 2026Buqing Ou, Frederike DümbgenTabular Foundation ModelsRobot Policy Learning

  20. Bayesian policy gradient and actor-critic algorithms

    Apr 30, 2026Mohammad Ghavamzadeh, Yaakov Engel, Michal ValkoBayesian RLTemporal-Difference Learning

  21. When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient

    Apr 28, 2026Shuning Shang, Hubert Strauss, Stanley Wei +2Reward ModelingPolicy Gradient

  22. Sample-efficient Neuro-symbolic Proximal Policy Optimization

    Apr 28, 2026Simone Murari, Celeste Veronese, Daniele MeliReinforcement LearningProximal Policy Optimization

  23. Dyna-Style Safety Augmented Reinforcement Learning: Staying Safe in the Face of Uncertainty

    Apr 28, 2026Artur Eisele, Bernd Frauenknecht, Friedrich Solowjow +1Robot SafetySafety Filtering

  24. Hierarchical Behaviour Spaces

    Apr 27, 2026Michael Tryfan Matthews, Anssi Kanervisto, Jakob Foerster +3Reinforcement LearningHierarchical RL

  25. GCImOpt: Learning efficient goal-conditioned policies by imitating optimal trajectories

    Apr 24, 2026Jon Goikoetxea, Jesús F. PalaciánRobotic ControlImitation Learning

  26. Preserve Support, Not Correspondence: Dynamic Routing for Offline Reinforcement Learning

    Apr 24, 2026Zhancun Mu, Guangyu Zhao, Yiwu Zhong +1Reinforcement LearningOffline RL

  27. Insect-inspired modular architectures as inductive biases for reinforcement learning

    Apr 23, 2026Anne E. StaplesRL ControlReinforcement Learning