Off-Policy RL

RL: Reinforcement Learning

Momentum

13 papers in the last four weeks, against 1 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 74

All topics
CardsList
  1. Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities

    May 7, 2026Armaan A. Abraham, Lucy Xiaoyang Shi, Chelsea FinnQ-LearningTemporal-Difference Learning

  2. OGPO: Sample Efficient Full-Finetuning of Generative Control Policies

    May 4, 2026Sarvesh Patil, Mitsuhiko Nakamoto, Manan Agarwal +14RL for RoboticsRL for Generative Models

  3. Learning from the Near Future: Temporal Self-Distillation for RLVR

    Apr 22, 2026Chuanyu Qin, Chenxu Yang, Qingyi Si +6Reinforcement Learning with Verifiable RewardsSelf-Distillation

  4. Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning

    Apr 21, 2026Yuan Zhuang, Yuexin Bian, Sihong He +7Low-Rank AdaptationOff-Policy RL

  5. TADPO: Reinforcement Learning Goes Off-road

    Mar 6, 2026Zhouchonghao Wu, Raymond Song, Vedant Mundheda +3End-to-End Autonomous DrivingAutonomous Driving

  6. GIPO: Gaussian Importance Sampling Policy Optimization

    Mar 4, 2026Chengxuan Lu, Zhenquan Zhang, Shukuan Wang +3Reinforcement LearningRL Post-Training

  7. Thinking Seeds: Leveraging Historical Diversity for Position-Aware RL in LLMs

    Jan 29, 2026Lei Yang, Wei Bi, Chenxi Sun +2RL for Language Model ReasoningRL Exploration

  8. Trust Region Masking for Long-Horizon LLM Reinforcement Learning

    Dec 28, 2025Yingru Li, Jiacai Liu, Jiawei Xu +4RL for Language ModelsReinforcement Learning

  9. Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization

    Nov 25, 2025Chenliang Li, Adel Elmahdy, Alex Boyd +7RL for Language Model ReasoningImportance Sampling

  10. Frictional Q-Learning

    Sep 24, 2025Hyunwoo Kim, Hyo Kyung LeeReinforcement LearningQ-Learning

  11. Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts

    Aug 13, 2025Maxime Heuillet, Yufei Cui, Boxing Chen +2RL for Language Model ReasoningEfficient Language Model Training

  12. Transductive Off-policy Proximal Policy Optimization

    Jun 6, 2024Yaozhong Gan, Renye Yan, Xiaoyang Tan +2Policy OptimizationProximal Policy Optimization

  13. Provably Efficient Off-Policy Adversarial Imitation Learning with Convergence Guarantees

    May 26, 2024Yilei Chen, Vittorio Giammarino, James Queeney +1Adversarial Imitation LearningImitation Learning