Off-Policy RL

RL: Reinforcement Learning

Momentum

13 papers in the last four weeks, against 1 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 74

All topics
CardsList
  1. Q-Learning with Scalar Adjoint Matching

    Oct 7, 2026Yonghoon Dong, Minsung Yoon, Jaehyuk Kim +3Q-LearningOff-Policy RL

  2. COPC: Coupled Off-Policy Correction for Asynchronous LLM Reinforcement Learning

    Oct 7, 2026Zicheng Hu, Zhijian Zhou, Xuan Zhang +7Asynchronous RLRL Post-Training

  3. QF3: Fast Flow RL with Filtered Q-Gradients

    Oct 6, 2026Chung Min Kim, Brent Yi, David McAllister +7Robotic RLRL for Legged Locomotion

  4. Hierarchical Time-aware Bootstrapping for Off-Policy Subgoal Value Learning

    Oct 4, 2026Bingyun Liu, Yuheng JingHierarchical RLTemporal-Difference Learning

  5. Asynchronous LLM Post-Training: Group-Mass Capping and Convergence Analysis

    Oct 1, 2026Qijia He, Ruinan Jin, Jun Luo +2Asynchronous RLRL for Language Model Reasoning

  6. Reusing Past Samples in Proximal Policy Optimization: When and How Does It Help?

    Oct 1, 2026Alessandro Montenegro, Riccardo Venturelli, Marco Mussi +2Experience ReplayProximal Policy Optimization

  7. ReSPO: Reshaped Sequence Policy Optimization for Gradient Starvation in Off-Policy Learning

    Sep 28, 2026Yihang Chen, Yuanhao Ban, Cho-Jui HsiehPolicy OptimizationReinforcement Learning with Verifiable Rewards

  8. Limiting-Kernel Q(λλ): Bridging Short and Long Horizons

    Sep 23, 2026Tolga Ok, Arman Sharifi Kolarijani, Peyman Mohajerin Esfahani +1Value Function EstimationPolicy Evaluation

  9. On Preference Coverage Collapse from Hindsight Relabeling in Multi-Objective Reinforcement Learning

    Sep 22, 2026Baptiste Bonin, Caro Strickland, Audrey DurandMulti-Objective Reinforcement LearningExperience Replay

  10. CARE-VI: Conservative Adaptive Reliability Estimation for Value Improvement in Off-Policy Actor-Critic Learning

    Sep 17, 2026Xiang Zou, Shengzhu Shi, Junqi Gao +1Temporal-Difference LearningActor-Critic Methods

  11. MInTRL: Off-policy Intervention can boost On-policy RL

    Sep 14, 2026Mingyu Chen, Yefan Tao, Gerald Friedland +2Reinforcement LearningReinforcement Learning with Verifiable Rewards

  12. Dream-RSI: Recursive Self-Improvement through Evolving Worlds

    Sep 14, 2026Tong Zheng, Xidong Wu, Zheng Zhang +14RL ExplorationSelf-Improving Agents

  13. BRACE: Anchored Bellman-Residual Correction for Stale Critics in Asynchronous RL

    Sep 9, 2026Guanqun Zhao, Zijun Xie, Binbin Zheng +3Asynchronous RLOff-Policy RL

  14. Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning

    Aug 3, 2026Abdelghani Ghanem, Mounir GhoghoQ-LearningTemporal-Difference Learning

  15. Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models

    Aug 3, 2026Wonseok Lee, Jimyeong Kim, Jungmin Ko +1RL for Language Model ReasoningRL for Diffusion Models

  16. Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning

    Aug 2, 2026Wenhao Zhang, Yibo Xie, Rui Wang +9Reinforcement LearningRL for Language Model Reasoning

  17. Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning

    Jul 29, 2026Gong Gao, Xiao Lai, Ziqi Xie +3Reinforcement LearningActor-Critic Methods

  18. Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning

    Jul 26, 2026Minh Vu, Konstantinos SlavakisGaussian Mixture ModelsInterpretability in RL

  19. Deconstructing Off-Policy Ratios: Entropy-Normalized Trust Regions for Asynchronous Reinforcement Learning

    Jul 24, 2026Guanqun Zhao, Zijun Xie, Binbin Zheng +5Asynchronous RLRL for Language Model Reasoning

  20. Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits

    Jul 24, 2026Yuta Natsubori, Masataka Ushiku, Yuta SaitoOff-Policy EvaluationContextual Bandits

  21. Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

    Jul 8, 2026Zhenyu Hou, Yujiang Li, Jie Tang +1Agentic RLAsynchronous RL

  22. Regime-Conditional Stabilisation of LLM-Augmented Cooperative Multi-Agent Reinforcement Learning

    Jul 5, 2026Faid Keddouri, Sohaib Houhou, Aissa Boulmerka +1Reward ShapingLLM-Guided RL