Policy Learning

Momentum

79 papers in the last four weeks, up 316% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 416

All topics
CardsList
  1. Higher-Order Action Supervision Makes A Strong Policy Class

    Oct 8, 2026Peng Cheng, Yunxian Hou, Zhi Zhou +3Policy LearningRobust RL

  2. Learning How to Search for Plans with Exponentially Less Space

    Oct 7, 2026Dominik Drexler, Simon Ståhlberg, Markus Fritzsche +1Symbolic PlanningPolicy Learning

  3. Policy Learning with Weak Signals

    Oct 7, 2026Benedikt Koch, Winston Chou, Aurélien Bibaut +1Policy LearningCausal Effect Estimation

  4. Learning Situation-Conditioned Thinking Policies for Long-Term LLM Agents

    Oct 7, 2026Hong SuLLM Agent MemoryLong-Horizon LLM Agents

  5. Towards the Automatic Synthesis of Interpretable Chess Tactics

    Oct 6, 2026Abhijeet Krishnan, Chris MartensGame-Playing AgentsChess

  6. Learning Explainable Representations of Complex Game-playing Strategies

    Oct 6, 2026Abhijeet Krishnan, Colin M. Potts, Arnav Jhala +3Game-Playing AgentsProgram Synthesis

  7. FERPO: Forward Entropy-Regularized Policy Optimization

    Oct 1, 2026Sebastian Sanokowski, Alireza Sarmadi, Majid KhadivKL-Regularized RLPolicy Optimization

  8. Q-Learning for Reachability in MEC-Free MDPs

    Oct 1, 2026Lu-Chin Chang, Suguman BansalMarkov Decision ProcessesReinforcement Learning

  9. Towards Optimal Policy Improvement

    Oct 1, 2026Yaniv Oren, Viliam Vadocz, Wiktor Zabka +7Markov Decision ProcessesPolicy Optimization

  10. Reusing Past Samples in Proximal Policy Optimization: When and How Does It Help?

    Oct 1, 2026Alessandro Montenegro, Riccardo Venturelli, Marco Mussi +2Experience ReplayProximal Policy Optimization

  11. Learning Multiple Timescales for Goal-Conditioned Reinforcement Learning

    Oct 1, 2026Pedro Robles Dutenhefner, Dikshant Shehmar, Wagner Meira +1Reinforcement LearningOffline RL

  12. Reward as Observation: Learning Reward-Based Policies for Rapid Adaptation

    Sep 30, 2026Morgan Byrd, Jacob Blevins, Maks Sorokin +2Robot Policy LearningRobot Policy Adaptation

  13. Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL

    Sep 30, 2026Tong Zheng, Skylar Zhai, Zhan Cheng +7Multi-Objective Reinforcement LearningReinforcement Learning

  14. PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents

    Sep 30, 2026Yinghui He, Yapei Chang, Khushi Bhardwaj +4Language Model DistillationLLM Agent Training

  15. Role-Adaptive Policy Optimization for Offline Reinforcement Learning

    Sep 30, 2026Seonvin Cho, Soohyun Choi, Songnam HongPolicy OptimizationOffline RL

  16. OPTS-TTPO: Enhancing Finite-Sample Policy-Gradient Learning with Tree Search

    Sep 30, 2026Junyu Lu, Shichao Weng, Zhiqiang Wang +10Tree SearchPolicy Gradient Methods

  17. Fast Regularized Policy Mirror Descent with One-Step TD Updates

    Sep 30, 2026Qipei Chen, Wenye Li, Yule Sun +1Markov Decision ProcessesPolicy Optimization

  18. T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning

    Sep 30, 2026Bo-Wen Zhang, Junwei He, Maoqi Liu +6Agentic RLReward Shaping

  19. From Imitation to Reward Discovery: On-Policy Warmup for Agentic RL

    Sep 30, 2026Yitong Qiao, Tiantian He, Lei Liu +4Agentic RLReinforcement Learning with Verifiable Rewards

  20. Understanding Off- vs On-Policy Distillation: A Tale of Distinct Training Objectives

    Sep 29, 2026Qiwei Di, Xuheng Li, Kaixuan Ji +3Multi-Teacher Knowledge DistillationOn-Policy Distillation

  21. Learning What to Remember: Long-horizon Counterfactual Memory Optimization

    Sep 29, 2026Jiaming Tang, Mingyan Liu, Armin SarabiMemory-Augmented Language ModelsPersistent Memory for Language Models

  22. Guide, Then Let Go: Gap-Adaptive Teacher Scheduling for Sparse-Reward Agentic RL

    Sep 29, 2026Youling Huang, Tiankuo Xu, Jiaji Liu +10Agentic RLLLM-Guided RL

  23. Video2STL: Grounding VLM-Generated Temporal Specifications for Robot Learning

    Sep 29, 2026Merve Atasever, Keyan Azbijari, Cagan Bakirci +6Robot Policy LearningSignal Temporal Logic

  24. Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training

    Sep 29, 2026Hongyang Li, Xiao Li, Caesar Wu +3Reinforcement LearningValue Function Estimation

  25. State Trace Rationale As Auxiliary Task in Reinforcement Learning

    Sep 29, 2026Muhammad U. Nasir, Alex Vogt, Steven D. James +1Reinforcement LearningRepresentation Learning for RL