Offline RL

RL: Reinforcement Learning

Momentum

29 papers in the last four weeks, up 222% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 189

All topics
CardsList
  1. Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning

    May 24, 2026Yu Yang, Yihong Guo, Anqi Liu +1Diffusion Model GuidanceReinforcement Learning

  2. Bilevel Optimization of Synthetic Trajectories for Multi-Turn LLM Fine-Tuning

    May 23, 2026Shresth Verma, Mauricio Tec, Cheol Woo Kim +2Synthetic Data AugmentationOffline RL

  3. Generative OOD-regularized Model-based Policy Optimization

    May 23, 2026Aysin Tumay, Jiahe Huang, Elise Jortberg +1Offline RLOOD Detection

  4. Abstraction for Offline Goal-Conditioned Reinforcement Learning

    May 21, 2026Clarisse Wibault, Alexander Goldie, Antonio Villares +2Hierarchical RLState Abstraction

  5. Target-Aligned Bellman Backup for Cross-domain Offline Reinforcement Learning

    May 21, 2026Wei Liu, Ting LongOffline RLCross-Domain Transfer Learning

  6. Compositional Transduction with Latent Analogies for Offline Goal-Conditioned Reinforcement Learning

    May 20, 2026Junseok Kim, Dohyeong Kim, Mineui Hong +1Reinforcement LearningRobotic RL

  7. Offline Reinforcement Learning for Plasma Control in Nuclear Fusion: Codebase and Benchmark

    May 19, 2026Yang Fu, Haomin Bao, Rohit Sonker +4RL BenchmarksOffline RL

  8. Precision Physical Activity Prescription via Reinforcement Learning for Functional Actions

    May 19, 2026Gefei Lin, Rui Miao, Jennifer Sacheck +1Reinforcement LearningOffline RL

  9. COOPO: Cyclic Offline-Online Policy Optimization Algorithm

    May 18, 2026Qisai Liu, Zhanhong Jiang, Joshua Russell Waite +3Offline RLSample-Efficient RL

  10. ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization

    May 18, 2026Yifei Chen, Shaoqin Zhu, Xiaoqiang JiPolicy OptimizationOffline RL

  11. Offline Reinforcement Learning with Universal Horizon Models

    May 15, 2026Hojun Chung, Junseo Lee, Songhwai OhOffline RLModel-Based RL

  12. Trajectory-Level Data Augmentation for Offline Reinforcement Learning

    May 13, 2026Tobias Schmähling, Matthias Burkhardt, Tobias WindischData AugmentationOffline RL

  13. Generative Support Realignment for Cross-Domain Offline Reinforcement Learning

    May 13, 2026Minung Kim, Jeongmo Kim, Gwanwoo Choi +1Offline RLCross-Domain Transfer Learning

  14. Offline Two-Player Zero-Sum Markov Games with KL Regularization

    May 13, 2026Claire Chen, Yuheng Zhang, Xinyu Liu +3Nash EquilibriumReinforcement Learning

  15. Model-based Bootstrap of Controlled Markov Chains

    May 12, 2026Ziwei Su, Imon Banerjee, Diego KlabjanMarkov Decision ProcessesOff-Policy Evaluation

  16. Robust Probabilistic Shielding for Safe Offline Reinforcement Learning

    May 11, 2026Maris F. L. Galesloot, Thomas Rhemrev, Nils JansenOffline RLSafe RL

  17. MSPR: Multi-scale Predictive Representations for Goal-conditioned Reinforcement Learning

    May 10, 2026Valliappan Chidambaram Adaikkappan, Sai Rajeswar, Pietro Mazzaglia +1Offline RLPredictive Representation Learning

  18. Offline Policy Optimization with Posterior Sampling

    May 8, 2026Hongqiang Lin, Dongxu Zhang, Yiding Sun +3OOD GeneralizationPosterior Sampling

  19. Hitting Time Isomorphism for Multi-Stage Planning with Foundation Policies

    May 7, 2026Magnus Victor Boock, Abdullah Akgül, Mustafa Mert Çelikok +1Sequential Decision MakingOffline RL

  20. Entropy-Regularized Adjoint Matching for Offline Reinforcement Learning

    May 7, 2026Abdelghani Ghanem, Mounir GhoghoFlow MatchingOffline RL

  21. Beyond Autoregressive RTG: Conditioning via Injection Outside Sequential Modeling in Decision Transformer

    May 7, 2026Yongyi Wang, Hanyu Liu, Lingfeng Li +6Efficient Transformer InferenceReinforcement Learning

  22. Offline Reinforcement Learning for Rotation Profile Control in Tokamaks

    May 7, 2026Rohit Sonker, Hiro Josep Farre Kaga, Jiayu Chen +5RL ControlOffline RL

  23. Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning

    May 7, 2026Nandiraju Gireesh, Yuanliang Ju, He WangQ-LearningOffline RL

  24. Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning

    May 6, 2026Qingjun Wang, Hongtu Zhou, Hang Yu +5Diffusion-Based OOD DetectionOffline RL

  25. Adaptive Estimation and Optimal Control in Offline Contextual MDPs without Stationarity

    May 5, 2026Riddhiman Bhattacharyya, Sayak Chakrabarty, Imon BanerjeeNon-Stationary RLMarkov Decision Processes