Policy Learning

Momentum

79 papers in the last four weeks, up 316% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 416

All topics
CardsList
  1. Dynamical Priors as a Training Objective in Reinforcement Learning

    Apr 23, 2026Sukesh SubaharanReinforcement LearningPolicy Gradient Methods

  2. Learning from the Near Future: Temporal Self-Distillation for RLVR

    Apr 22, 2026Chuanyu Qin, Chenxu Yang, Qingyi Si +6Reinforcement Learning with Verifiable RewardsSelf-Distillation

  3. Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning

    Apr 22, 2026Aravind Venugopal, Jiayu Chen, Xudong Wu +3Reward ShapingTemporal Credit Assignment

  4. Ask Only When Needed: Proactive Retrieval from Memory and Skills for Experience-Driven Lifelong Agents

    Apr 22, 2026Yuxuan Cai, Wei Li, Jie Zhou +4Lifelong Learning AgentsLLM Agent Skill Learning

  5. Lever: Inference-Time Policy Reuse under Support Constraints

    Apr 22, 2026Ihor Vitenko, Noha Ibrahim, Sihem Amer-YahiaOffline RLPolicy Learning

  6. EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training

    Apr 21, 2026Chengjun Pan, Shichun Liu, Jiahang Lin +10RL for Language ModelsPolicy Gradient Methods

  7. Intentional Updates for Streaming Reinforcement Learning

    Apr 21, 2026Arsalan Sharifnassab, Mohamed Elsayed, Kris De Asis +2Reinforcement LearningTemporal-Difference Learning

  8. Accelerating trajectory optimization with Sobolev-trained diffusion policies

    Apr 21, 2026Théotime Le Hellard, Franki Nguimatsia Tiofack, Quentin Le Lidec +1Trajectory OptimizationTrajectory Generation

  9. Bounded Ratio Reinforcement Learning

    Apr 20, 2026Yunke Ao, Le Chen, Bruce D. Lee +5Reinforcement LearningGroup Relative Policy Optimization

  10. Reducing Credit Assignment Variance via Counterfactual Reasoning Paths

    Apr 20, 2026Fei Ding, Yongkang Zhang, Youwei Wang +1RL for Language Model ReasoningCredit Assignment in RL

  11. Does "Do Differentiable Simulators Give Better Policy Gradients?'' Give Better Policy Gradients?

    Apr 20, 2026Ku Onoda, Paavo Parmas, Manato Yaguchi +1Policy GradientRobotic RL

  12. Efficient Federated RLHF via Zeroth-Order Policy Optimization

    Apr 20, 2026Deyi Wang, Qining Zhang, Lei YingFederated RLCommunication-Efficient Distributed Training

  13. Poly-EPO: Training Exploratory Reasoning Models

    Apr 19, 2026Ifdita Hasan Orney, Jubayer Ibn Hamid, Shreya S Ramanujam +5Reinforcement LearningRL for Language Model Reasoning

  14. Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning

    Apr 18, 2026Weiyu Ma, Yongcheng Zeng, Yan Song +4Reinforcement LearningRL Post-Training

  15. Sample Complexity Bounds for Stochastic Shortest Path with a Generative Model

    Apr 17, 2026Jean Tarbouriech, Matteo Pirotta, Michal Valko +1Markov Decision ProcessesPolicy Learning

  16. Beyond Single-Model Optimization: Preserving Plasticity in Continual Reinforcement Learning

    Apr 16, 2026Lute Lillo, Nick CheneyNon-Stationary RLReinforcement Learning

  17. Mean Flow Policy Optimization

    Apr 16, 2026Xiaoyi Dong, Xi Sheryl Zhang, Jian ChengMeanFlowMean Flow

  18. Policy Improvement Reinforcement Learning

    Apr 1, 2026Huaiyang Wang, Xiaojie Li, Xiaohan Wang +10RL for Language ModelsRL for Language Model Reasoning

  19. DeepStock: Reinforcement Learning with Policy Regularizations for Inventory Management

    Mar 20, 2026Yaqi Xie, Xinru Hao, Jiaxi Liu +4Inventory ControlReinforcement Learning

  20. Reinforcing the World's Edge: A Continual Learning Problem in the Multi-Agent-World Boundary

    Mar 6, 2026Dane MalenfantNon-Stationary RLDecentralized MARL

  21. Temporal Consistency Improves Generalization in Contextual Offline Meta Reinforcement Learning

    Mar 3, 2026Mohammadreza Nakheai, Aidan Scannell, Kevin Luck +1Representation LearningOffline RL

  22. Multi-agent imitation learning with function approximation: Linear Markov games and beyond

    Feb 26, 2026Luca Viano, Till Freihaut, Emanuele Nevali +3Game TheoryImitation Learning

  23. ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning

    Feb 25, 2026Xiaoxuan Wang, Han Zhang, Haixin Wang +11Agentic RLReinforcement Learning

  24. TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents

    Feb 12, 2026Aladin Djuhera, Swanand Kadhe, Farhan Ahmed +3Tree SearchLLM Agent Training

  25. On the Role of Computation in Reinforcement Learning

    Feb 5, 2026Raj Ghugare, Michał Bortkiewicz, Alicja Ziarko +1Reinforcement LearningModel-Free RL

  26. Constrained Group Relative Policy Optimization

    Feb 5, 2026Roger Girgis, Rodrigue de Schaetzen, Luke Rowe +3Group Relative Policy OptimizationConstrained RL