Offline RL

RL: Reinforcement Learning

Momentum

29 papers in the last four weeks, up 222% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 189

All topics
CardsList
  1. Individual Control Barrier Functions-Guided Diffusion Model for Safe Offline Multi-Agent Reinforcement Learning

    Jun 10, 2026Qingyun Guo, Junyi Shi, Jianuo Huang +1Control Barrier FunctionsOffline RL

  2. Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning

    Jun 9, 2026Zhiyuan Zhou, Andy Peng, Charles Xu +4Policy OptimizationOffline RL

  3. Fast and Highly Expressive Policy Learning for Offline Reinforcement Learning via Bootstrapped Flow Q-Learning

    Jun 9, 2026Thanh Nguyen, Tri Ton, Hongbin Choe +2Flow MatchingQ-Learning

  4. Safe-RULE: Safe Reinforcement UnLEarning

    Jun 8, 2026Shixiong Jiang, Taozheng Zhu, Fanxin KongOffline RLSafe RL

  5. Goal Sets, Not Goal States: Queryable Robot Goals through Goal-Set Hindsight Relabeling

    Jun 8, 2026Carlos Vélez García, Miguel Cazorla, Jorge PomaresOffline RLGoal-Conditioned RL

  6. Counterfactual Transport Flows for Offline Conservative Trajectory Refinement

    Jun 8, 2026Lena Krieger, Xuan Zhao, Zhuo Cao +3Trajectory OptimizationOffline RL

  7. Neuro-Symbolic Injection of LTLf Constraints in Autoregressive Reinforcement Learning Policies

    Jun 6, 2026Ashkan Ansarifard, Matteo Mancanelli, Elena Umili +1Reinforcement LearningTransformer-Based RL

  8. FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization

    Jun 3, 2026Yihao Wu, He Zhang, Junbo Tan +2Offline RLVision-Language-Action Models

  9. Generalizable Multi-Task Learning for Wireless Networks Using Prompt Decision Transformers

    Jun 3, 2026Fatih Temiz, Shavbo Salehi, Melike Erol-KantarciReinforcement LearningTransformer

  10. Dual Advantage Fields

    Jun 2, 2026Alexey Zemtsov, Maxim Bobrin, Alexander Nikulin +5Offline RLGoal-Conditioned RL

  11. When Offline Selectors Cannot Beat the Best Single Model: A Diagnostic Study on edX Dropout Prediction

    Jun 2, 2026Tyler Crosse, Alan Nadelsticher Ruvalcaba, Dustin Khang LeDuc +3Model SelectionEducational Data Mining

  12. From Reward-Free Representations to Preferences: Rethinking Offline Preference-Based Reinforcement Learning

    May 31, 2026Jun-Jie Yang, Chia-Heng Hsu, Kui-Yuan Chen +1Pairwise Preference LearningRepresentation Learning

  13. Interaction-Limited Safe Continuous-Time RL for Dynamical Medical Treatment

    May 31, 2026Xun Shen, Yuepeng Wang, Akifumi Wachi +13Reinforcement LearningSequential Decision Making

  14. Behavior-Invariant Task Representation Learning with Transformer-based World Models for Offline Meta-Reinforcement Learning

    May 30, 2026Fuyuan Qian, Menglong Zhang, Song Wang +1Representation LearningOffline RL

  15. Regularized Offline Policy Optimization with Posterior Hybrid Bayesian Belief

    May 30, 2026Hongqiang Lin, Pengfei Wang, Nenggan ZhengReinforcement LearningBayesian RL

  16. Drift Q-Learning

    May 29, 2026Anas Houssaini, Mohamad H. Danesh, Amin Abyaneh +3Reinforcement LearningQ-Learning

  17. DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization

    May 29, 2026Jian Mu, Tianyi Lin, Chengwei Qin +2Supervised Fine-TuningRL for Language Models

  18. Efficient Post-training of LLMs for Code Generation With Offline Reinforcement Learning

    May 27, 2026Mingze Wu, Abhinav Anand, Shweta Verma +1RL for Code GenerationOffline RL

  19. Adaptive Coarse-to-Fine Subgoal Refinement for Long-Horizon Offline Goal-Conditioned Reinforcement Learning

    May 27, 2026Kaiqiang Ke, Shenghong He, Chengdong Xu +3Hierarchical RLOffline RL

  20. SPAR: Support-Preserving Action Rectification

    May 27, 2026Jiaxin Zhao, Weihang Pan, Xun Liang +1Imitation LearningOffline RL

  21. Trust Region Q Adjoint Matching

    May 26, 2026Yonghoon Dong, Kyungmin Lee, Changyeon Kim +2Reinforcement LearningKL-Regularized RL

  22. Exploiting Local Dynamics Regularity for Reusable Skills in Offline Hierarchical RL

    May 25, 2026Sarthak Dayal, Abhinav Peri, Carl Qi +4Hierarchical RLOffline RL

  23. Latent Representation Alignment for Offline Goal-Conditioned Reinforcement Learning

    May 25, 2026Hyungkyu Kang, Byeongchan Kim, Min-hwan OhReinforcement LearningOffline RL

  24. Back to Parsimonious Latents: Learning Task-Centric World Models from Visual Foundations

    May 25, 2026Minghao Fu, Fan Feng, Nicklas Hansen +1World Model LearningWorld Models

  25. SeqRoute: Global Budget-Aware Sequential LLM Routing via Offline Reinforcement Learning

    May 25, 2026Zhongling Xu, Shunan Zheng, Wei WangCost-Aware InferenceOffline RL

  26. Unifying Value Alignment and Assignment in Cross-Domain Offline Reinforcement Learning with Heterogeneous Datasets

    May 24, 2026Zhongjian Qiao, Jiafei Lyu, Chenjia Bai +3Offline RLCross-Domain Transfer Learning