Off-Policy RL

RL: Reinforcement Learning

Momentum

13 papers in the last four weeks, against 1 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 74

All topics
CardsList
  1. MPC-Injection: Biasing Off-Policy Locomotion RL Toward Controller-Induced Behavior Basins

    Jun 24, 2026Roy Xing, Seyoung Ree, Brian PlancherReinforcement LearningRL for Legged Locomotion

  2. What are Key Factors for Updates in RL for LLM Reasoning?

    Jun 21, 2026Peidong Wang, Demi Wang, Xufang Luo +5Reinforcement LearningRL for Language Model Reasoning

  3. Reversal Q-Learning

    Jun 16, 2026Aditya Oberai, Seohong Park, Sergey LevineReinforcement LearningQ-Learning

  4. Replay What Matters: Off-Policy Replay for Efficient LLM Reinforcement Unlearning

    Jun 13, 2026Zirui Pang, Chenlong Zhang, Haosheng Tan +3Experience ReplayMachine Unlearning

  5. Mitigating Bias in Low-SNR Financial Reinforcement Learning via Quantum Representations

    Jun 9, 2026Zeyu Liu, Xuanzhi Feng, Sing Kwong Lai +6Quantitative FinanceQuantum Machine Learning

  6. Rethinking the Divergence Regularization in LLM RL

    Jun 8, 2026Jiarui Yao, Xiangxin Zhou, Penghui Qi +3RL for Language ModelsPolicy Optimization

  7. Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards

    Jun 1, 2026Christian Scherer, Joe Watson, Theo Gruner +3Reinforcement LearningRobot Skill Learning

  8. PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning

    May 29, 2026Daize Dong, Junlin Chen, Haolong Jia +9RL for Language Model ReasoningExpert Routing

  9. Off-Policy Learning to Reason Works Because It Is More Pessimistic Than You Think

    May 27, 2026Otmane Sakhi, Aleksei Arzhantsev, Imad Aouali +1Reinforcement LearningRL for Language Model Reasoning

  10. Extreme Region Policy Distillation

    May 25, 2026Changyu Chen, Xiting Wang, Rui YanKL-Regularized RLRL for Language Model Reasoning

  11. Goal-Conditioned Agents that Learn Everything All at Once

    May 22, 2026Michael Matthews, Matthew Jackson, Michael Beukman +5Policy LearningSample-Efficient RL

  12. F-TIS: Harnessing Diverse Models in Collaborative GRPO

    May 21, 2026Nikolay Blagoev, Oğuzhan Ersoy, Wendelin Boehmer +1RL for Language ModelsCommunication-Efficient Distributed Training

  13. Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent

    May 20, 2026Zeyuan Wang, Da Li, Yulin Chen +6Reinforcement LearningMaximum Entropy RL

  14. Behavior-Aware Auxiliary Corrections for Off-Policy Temporal-Difference Prediction

    May 17, 2026Xingguo Chen, Zhiang He, Yuchen Shen +4Temporal-Difference LearningLinear Function Approximation

  15. Achieving ε−2ε^{-2} Sample Complexity for Single-Loop Actor-Critic under Minimal Assumptions

    May 13, 2026Ishaq Hamza, Zaiwei ChenPolicy GradientLast-Iterate Convergence

  16. Trajectory-Level Data Augmentation for Offline Reinforcement Learning

    May 13, 2026Tobias Schmähling, Matthias Burkhardt, Tobias WindischData AugmentationOffline RL

  17. Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction

    May 12, 2026Zhong Guan, Yongjian Guo, Haoran Sun +5Asynchronous RLReinforcement Learning

  18. Debiased Model-based Representations for Sample-efficient Continuous Control

    May 12, 2026Jiafei Lyu, Zichuan Lin, Scott Fujimoto +5Representation LearningContinuous Control

  19. Selective Off-Policy Reference Tuning with Plan Guidance

    May 12, 2026Duc Anh Le, Tien-Phat Nguyen, Thien Huu Nguyen +2Reinforcement LearningRL for Language Model Reasoning

  20. When Does Non-Uniform Replay Matter in Reinforcement Learning?

    May 11, 2026Michal Korniak, Mikołaj Czarnecki, Yarden As +3Experience ReplaySample-Efficient RL

  21. Actor-Critic Algorithm for Dynamic Expectile and CVaR

    May 8, 2026Yudong Luo, Erick DelageReinforcement LearningRisk-Sensitive RL

  22. Actor-Critic with Active Importance Sampling

    May 8, 2026Majid Molaei, Gabor Paczolay, Matteo Papini +2Reinforcement LearningPolicy Gradient Methods

  23. How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment

    May 7, 2026Rui Zhu, Weiheng Bai, Qiushi Wu +3LLM AlignmentKV-Cache Compression