Offline RL

RL: Reinforcement Learning

Momentum

29 papers in the last four weeks, up 222% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 189

All topics
CardsList
  1. Decoupled Guidance Diffusion for Adaptive Offline Safe Reinforcement Learning

    May 4, 2026Rufeng Chen, Zhaofan Zhang, Zhejiang Yang +2Diffusion-Based PlanningDiffusion Guidance

  2. On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization

    May 4, 2026Kaixuan Ji, Qiwei Di, Heyang Zhao +2Multi-Armed BanditsSample Complexity

  3. AdamO: A Collapse-Suppressed Optimizer for Offline RL

    May 3, 2026Nan Qiao, Sheng Yue, Shuning Wang +1Reinforcement LearningTemporal-Difference Learning

  4. QHyer: Q-conditioned Hybrid Attention-mamba Transformer for Offline Goal-conditioned RL

    May 3, 2026Xing Lei, Jincheng Wang, Xuetao Zhang +1Offline RLSparse-Reward RL

  5. Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning

    May 3, 2026Sungyoung Lee, Dohyeong Kim, Eshan Balachandar +2Distributional RLQ-Learning

  6. Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data

    May 2, 2026Ruiqi Xue, Lei Yuan, Kainuo Cheng +2LLM-Guided RLOffline RL

  7. Pessimism-Free Offline Learning in General-Sum Games via KL Regularization

    Apr 30, 2026Claire Chen, Yuheng ZhangNash EquilibriumReinforcement Learning

  8. GUI Agents with Reinforcement Learning: Toward Digital Inhabitants

    Apr 30, 2026Junan Hu, Jian Liu, Jingxiang Lai +6Reinforcement LearningRL for GUI Agents

  9. TSN-Affinity: Similarity-Driven Parameter Reuse for Continual Offline Reinforcement Learning

    Apr 28, 2026Dominik Żurek, Kamil Faber, Marcin Pietron +2Continual LearningRobotic RL

  10. Improving Zero-Shot Offline RL via Behavioral Task Sampling

    Apr 28, 2026Nazim Bendib, Nicolas Perrin-Gilbert, Olivier SigaudReinforcement LearningOffline RL

  11. DLM: Unified Decision Language Models for Offline Multi-Agent Sequential Decision Making

    Apr 26, 2026Zhuohui Zhang, Bin Cheng, Bin HeSequential MARLOffline RL

  12. Learning from Demonstration with Failure Awareness for Safe Robot Navigation

    Apr 25, 2026Xianghui Wang, Siwei Cheng, Shanze Wang +3Safe Robot NavigationOffline RL

  13. CODA: Coordination via On-Policy Diffusion for Multi-Agent Offline Reinforcement Learning

    Apr 25, 2026Marcel Hedman, Kale-ab Abebe Tessera, Juan Claude Formanek +5Multi-Agent CoordinationOffline RL

  14. SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning

    Apr 24, 2026Jichao Wang, Liuyang Bian, Yufeng Zhou +9RL for GUI AgentsCredit Assignment in RL

  15. Preserve Support, Not Correspondence: Dynamic Routing for Offline Reinforcement Learning

    Apr 24, 2026Zhancun Mu, Guangyu Zhao, Yiwu Zhong +1Reinforcement LearningOffline RL

  16. When Policies Cannot Be Retrained: A Unified Closed-Form View of Post-Training Steering in Offline Reinforcement Learning

    Apr 23, 2026Elias Hossain, Mohammad Jahid Ibna Basher, Ivan Garibay +2Offline RLRL Post-Training

  17. Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning

    Apr 22, 2026Aravind Venugopal, Jiayu Chen, Xudong Wu +3Reward ShapingTemporal Credit Assignment

  18. Lever: Inference-Time Policy Reuse under Support Constraints

    Apr 22, 2026Ihor Vitenko, Noha Ibrahim, Sihem Amer-YahiaOffline RLPolicy Learning

  19. Fisher Decorator: Refining Flow Policy via a Local Transport Map

    Apr 20, 2026Xiaoyuan Cheng, Haoyu Wang, Wenxuan Yuan +4Flow MatchingOffline RL

  20. GUIDE: Reinforcement Learning for Behavioral Action Support in Type 1 Diabetes

    Apr 1, 2026Saman Khamesian, Sri Harini Balaji, Di Yang Shi +5Reinforcement LearningType 1 Diabetes

  21. SutureFormer: Learning Surgical Trajectories via Goal-conditioned Offline RL in Pixel Space

    Mar 19, 2026Huanrong Liu, Chunlin Tian, Tongyu Jia +8Offline RLTrajectory Prediction

  22. Safe Flow Q-Learning: Offline Safe Reinforcement Learning with Reachability-Based Flow Policies

    Mar 16, 2026Mumuksh Tayal, Manan Tayal, Ravi PrakashFlow MatchingOffline RL

  23. Latent Policy Steering through One-Step Flow Policies

    Mar 5, 2026Hokyun Im, Andrey Kolobov, Jianlong Fu +1RL for RoboticsLatent Action Learning

  24. Temporal Consistency Improves Generalization in Contextual Offline Meta Reinforcement Learning

    Mar 3, 2026Mohammadreza Nakheai, Aidan Scannell, Kevin Luck +1Representation LearningOffline RL

  25. Beyond Success Rates: Trainability and Extractability for Offline GCRL

    Feb 5, 2026Jan Malte Töpperwien, Aditya Mohan, Marius LindauerRL BenchmarksOffline RL

  26. Chain-of-Goals Hierarchical Policy for Long-Horizon Offline Goal-Conditioned RL

    Feb 3, 2026Jinwoo Choi, Sang-Hyun Lee, Seung-Woo SeoReinforcement LearningHierarchical RL

  27. Offline Reinforcement Learning of High-Quality Behaviors Under Robust Style Alignment

    Jan 30, 2026Mathieu Petitbois, Rémy Portelas, Sylvain LamprierReinforcement LearningOffline RL