Policy Learning

Momentum

79 papers in the last four weeks, up 316% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 416

All topics
CardsList
  1. Reversal Q-Learning

    Jun 16, 2026Aditya Oberai, Seohong Park, Sergey LevineReinforcement LearningQ-Learning

  2. When Robots Sleep: Offline Skill Consolidation for Shared-Policy Robot Learning

    Jun 16, 2026Nethmi Jayasinghe, Diana Gontero, Amit Ranjan TrivediRobot Policy LearningContinual Robot Learning

  3. Where Should Action Generation Begin? A Learnable Source Prior for Generative Robot Policies

    Jun 16, 2026Meipo Dai, Qiyuan Zhuang, He-Yang Xu +4Robot Policy LearningRobotic Manipulation

  4. A First-Principles Derivation of LLM Policy Optimization: From Expected Reward to GRPO and Its Structural Extensions

    Jun 15, 2026Jianghan Shen, Siqi Luo, Yue Li +9RL for Language ModelsGroup Relative Policy Optimization

  5. Learning Policy from a Single Trajectory in Average-Reward Markov Decision Process

    Jun 15, 2026Jongmin Lee, Ernest K. Ryu, Vaneet AggarwalMarkov Decision ProcessesReinforcement Learning

  6. Direction-Conditioned Policies via Compositional Subgoal Scoring for Online Goal-Conditioned Reinforcement Learning

    Jun 15, 2026Swaminathan S K, Damiya Gondha, Theyanesh Eswaramoorthy Rajahkrishnan +1Contrastive RLPolicy Learning

  7. Replay What Matters: Off-Policy Replay for Efficient LLM Reinforcement Unlearning

    Jun 13, 2026Zirui Pang, Chenlong Zhang, Haosheng Tan +3Experience ReplayMachine Unlearning

  8. Discovering Lattice Reduction Strategies via Self-Play

    Jun 13, 2026Mohamed Malhou, Kristin Lauter, Ludovic PerretReinforcement LearningRL for Combinatorial Optimization

  9. Retrospective Progress-Aware Self-Refinement for LLM Agent Training

    Jun 12, 2026Xinbei Ma, Congmin Zheng, Jiyang Qiu +11Reward ShapingLLM Agent Training

  10. Lyapunov-Based Sample Complexity Analysis for Weakly-Coupled MDPs

    Jun 12, 2026Tianhao Wu, Matthew Zurek, Weina Wang +1Multi-Armed BanditsRobust Markov Decision Processes

  11. Human-like autonomy emerges from self-play and a pinch of human data

    Jun 11, 2026Daphne Cornelisse, Julian Hunt, Zixu Zhang +4Self-Play RLAutonomous Driving

  12. QPILOTS: Efficient Test-Time Q-Steering for Flow Policies

    Jun 11, 2026Yifan Ruan, Chenyang Cao, Andreas Burger +7Inference-Time OptimizationDiffusion Policy

  13. APPO: Agentic Procedural Policy Optimization

    Jun 10, 2026Xucong Wang, Ziyu Ma, Yong Wang +5Agentic RLCredit Assignment in RL

  14. PAWS: Preference Learning with Advantage-Weighted Segments

    Jun 10, 2026Aleksandar Taranovic, Onur Celik, Niklas Freymuth +6Credit Assignment in RLRobotic RL

  15. Deterministic Policy Gradient for Learning Equilibrium in Time-Inconsistent Control Problems

    Jun 10, 2026Xin Guo, Yijie Huang, Xiang YuPolicy GradientStochastic Optimal Control

  16. MODIP: Efficient Model-Based Optimization for Diffusion Policies

    Jun 9, 2026Zakariae El Asri, Philippe Gratias-Quiquandon, Nicolas Thome +1Robot Policy LearningRobot Policy Adaptation

  17. Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training

    Jun 9, 2026João Coelho, João Magalhães, Bruno Martins +1Reinforcement LearningGroup Relative Policy Optimization

  18. Convergence of Monte Carlo Optimistic Policy Iteration: Beyond Uniform State-Action Updates

    Jun 9, 2026Octave Oliviers, Glenn VinnicombeMarkov Decision ProcessesReinforcement Learning

  19. SHAPO: Sharpness-Aware Policy Optimization for Safe Exploration

    Jun 8, 2026Kaustubh Mani, Yann Pequignot, Vincent Mai +1Sharpness-Aware MinimizationRL Exploration

  20. Discovering Interpretable Multi-Parameter Control Policies for Evolutionary Algorithms Using Deep Reinforcement Learning

    Jun 8, 2026Tai Nguyen, Phong Le, Carola Doerr +1Evolutionary OptimizationDeep Q-Learning

  21. An Agency-Transferring Model-Free Policy Enhancement Technique

    Jun 8, 2026Anton Bolychev, Georgiy Malaniya, Sinan Ibrahim +1RL ControlTransfer Learning

  22. Difference-Aware Retrieval Policies for Imitation Learning

    Jun 8, 2026Quinn Pfeifer, Ethan Pronovost, Paarth Shah +3Imitation LearningInteractive Imitation Learning

  23. 3SPO: State-Score-Supervised Policy Optimization for LLM Agents

    Jun 8, 2026Yu Han, Kailing Li, Yang Jiao +4Credit Assignment in RLStep-Level Credit Assignment in RL

  24. Are Good Generators Good Decision-Makers? Policy Learning for General Interventions via Retargeted Counterfactual Generation

    Jun 5, 2026Raphael C Kim, Jingsen Zhu, Ramin Zabih +1Reinforcement LearningCausal Counterfactual Generation

  25. On Advantage Estimates for Max@K Policy Gradients

    Jun 4, 2026Shota Takashiro, Soichiro Nishimori, Paavo Parmas +6Policy GradientPolicy Gradient Methods

  26. MDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction Following

    Jun 4, 2026Mohammad Mahdi Salmani-Zarchi, Zahra Rahimi, Heshaam Faili +1Group Relative Policy OptimizationInstruction Following

  27. Retry Policy Gradients in Continuous Action Spaces

    Jun 4, 2026Soichiro Nishimori, Paavo ParmasPolicy OptimizationRL Exploration

  28. When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training

    Jun 4, 2026Yuanfan Li, Qi Zhou, Wenjing Duan +1Credit Assignment in RLStep-Level Credit Assignment in RL