Offline RL

RL: Reinforcement Learning

Momentum

29 papers in the last four weeks, up 222% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 189

All topics
CardsList
  1. Evaluating covariate balance for long time horizon Markov decision processes

    Jul 16, 2026Joshua Spear, Rebecca Pope, Neil J SebireCausal Effect EstimationReinforcement Learning

  2. RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences

    Jul 15, 2026Logan Mondal Bhamidipaty, Mykel Kochenderfer, Subramanian RamamoorthyWorld Model LearningOffline RL

  3. Active Offline-to-Online Reinforcement Learning

    Jul 13, 2026Alper Kamil Bozkurt, Shangtong Zhang, Yuichi MotaiOffline RLRL Fine-Tuning

  4. VINE: Taming Generative Control Policies for Reinforcement Learning

    Jul 11, 2026Rushuai Yang, Zhuo Han, Houlin Li +10RL for RoboticsOffline RL

  5. Shortcut Trajectory Planning for Efficient Offline Reinforcement Learning

    Jul 10, 2026Guanquan Wang, Yoshimasa TsuruokaTrajectory GenerationOffline RL

  6. NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL

    Jul 8, 2026Erdemt Bao, Xing Lei, Jun Chen +2Normalizing FlowsHierarchical RL

  7. Fitted Occupancy-Ratio Evaluation without Bellman Completeness

    Jul 6, 2026Lars van der Laan, Nathan KallusOff-Policy EvaluationOffline RL

  8. Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning

    Jul 5, 2026Haiwen Yi, Xinyuan SongOffline RLLLM Agent Harnesses

  9. CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning

    Jul 4, 2026Jiayi Guan, Tianle Zhang, Li Shen +8Reinforcement LearningConstrained RL

  10. A Hierarchy of Policy Learning Problems

    Jul 3, 2026Hamsa Bastani, Osbert Bastani, Shihan ChenSample ComplexityOffline RL

  11. Generalization in offline RL: The structure is more important than the amount of pessimism

    Jul 2, 2026Max Weltevrede, Matthijs T. J. Spaan, Wendelin BöhmerReinforcement LearningOffline RL

  12. SPLC: Social Preference Learning for Crowd Robot Navigation

    Jul 2, 2026Zixuan Chen, Hao Fu, Haiwen Hu +1Robot NavigationSocial Robot Navigation

  13. AETDICE: Unified Framework and Offline Optimization for Nonlinear Multi-Objective RL

    Jun 30, 2026Woosung Kim, Youngjun Suh, Jinho Lee +2Multi-Objective Reinforcement LearningOffline RL

  14. Offline Reinforcement Learning for Fluid Controls: Data-based Multi-observational Policy Extraction

    Jun 30, 2026Deepak Akhare, Luning Sun, Xin-Yang Liu +4RL ControlReinforcement Learning

  15. STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning

    Jun 29, 2026Zhihao Liu, Qiuyi Gu, Yitao Wang +16Robot Policy LearningRobot Skill Learning

  16. Offline Multi-agent Continual Cooperation via Skill Partition and Reuse

    Jun 24, 2026Yuchen Xiao, Lei Yuan, Ruiqi Xue +2Offline RLAgent Skill Learning

  17. Offline Reinforcement Learning for Warehouse SLAM Throughput Control

    Jun 22, 2026Tina Dongxu Li, Mouhacine Benosman, Rajat Kumar +3RL ControlOffline RL

  18. Weight-Space Geometry of Offline Reasoning Training

    Jun 21, 2026Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov +1RL for Language ModelsDirect Preference Optimization

  19. Horizon Adaptive Offline Policy Learning via Value Stitching

    Jun 19, 2026Kexin Zheng, Xianyuan Zhan, Xintao YanValue Function EstimationOffline RL

  20. Off-Policy Evaluation for Missingness-Aware Policies in MDPs with Rewards Missing Not at Random

    Jun 18, 2026Ziheng Wei, Annie Qu, Rui MiaoReinforcement LearningOff-Policy Evaluation

  21. Insulin4RL: Real-Time Insulin Management in the Intensive Care Unit for Offline Reinforcement Learning

    Jun 17, 2026Thomas Frost, Steve HarrisRL BenchmarksOffline RL

  22. Wasserstein Policy Learning for Distributional Outcomes

    Jun 17, 2026Yiyan Huang, Cheuk Hang Leung, Qi Wu +1Offline RLWasserstein Barycenters

  23. When Does Trajectory-Level Supervision Permit Efficient Offline Reinforcement Learning?

    Jun 16, 2026Xuanfei Ren, Tengyang XieOffline RL

  24. Reversal Q-Learning

    Jun 16, 2026Aditya Oberai, Seohong Park, Sergey LevineReinforcement LearningQ-Learning

  25. Video-Based Optimal Transport for Feedback-Efficient Offline Preference-Based Reinforcement Learning

    Jun 15, 2026Tung M. Luu, Hwanhee Kim, Younghwan Lee +1Offline RLSemi-Supervised Learning

  26. Diffusion Offline Reinforcement Learning for Fair and Energy-Efficient UAV-Assisted Wireless Networks

    Jun 15, 2026Eslam Eldeeb, Hirley AlvesOffline RLWireless Communications

  27. DRIVE: Distributional and Retrieval-Augmented Bidding with Value Evaluation

    Jun 12, 2026Miduo Cui, Haochen Wang, Shangqin Mao +6Distributional RLAutomated Bidding