Offline RL

RL: Reinforcement Learning

Momentum

29 papers in the last four weeks, up 222% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 189

All topics
CardsList
  1. Higher-Order Action Supervision Makes A Strong Policy Class

    Oct 8, 2026Peng Cheng, Yunxian Hou, Zhi Zhou +3Policy LearningRobust RL

  2. World-Model Policy Arbiter for Goal-Conditioned Reinforcement Learning

    Oct 7, 2026Junwei Quan, Evgenii Opryshko, Nicholas Rhinehart +1Goal-Conditioned RLOffline RL

  3. Beyond Policy Support: Interaction Constrained Offline Reinforcement Learning for Autonomous Driving

    Oct 7, 2026Mahmoud Selim, Cristina Cipriani, Karl Henrik JohanssonOffline RLDistribution Shift

  4. An Informational Curse of Horizon in Goal-Conditioned Policy Learning

    Oct 7, 2026John L. Zhou, Yuxuan Dong, Jonathan C. KaoGoal-Conditioned RLGeneralization in RL

  5. LASER: Latent Space Adjoint Matching for Support-Constrained Entropy-Regularized Offline RL

    Oct 6, 2026Songyuan Zhang, Oswin So, Eric Yang Yu +3Reinforcement LearningOffline RL

  6. Directed Temporal Representations for Offline Visual Control

    Oct 6, 2026Chenyang Yuan, Haoyu Wang, Zhuo Sun +1Visual RLTrajectory Representation Learning

  7. Variance-Averse nn-Step Offline Reinforcement Learning for Sparse Long-Horizon Environments

    Oct 6, 2026Guhyeon Kang, Minhae KwonDistributional RLRisk-Sensitive RL

  8. Pessimistic Minimax Learning for Public-Private Information Games under Unilateral Coverage

    Oct 4, 2026Shuze Daniel Liu, Claire Chen, Jiuqi Wang +1Imperfect-Information GamesZero-Sum Games

  9. Decision Titan: Test-Time Training for Long-Term Memory in Offline Reinforcement Learning

    Oct 1, 2026Jude Waide, Robert LieckReinforcement LearningTransformer-Based RL

  10. Learning Multiple Timescales for Goal-Conditioned Reinforcement Learning

    Oct 1, 2026Pedro Robles Dutenhefner, Dikshant Shehmar, Wagner Meira +1Reinforcement LearningOffline RL

  11. Learning Goal-Reaching Quasimetric Geometry From Finite-Time Reachability

    Sep 30, 2026Daisuke Yamada, Travis Pence, Vikas SinghMetric LearningOffline RL

  12. Role-Adaptive Policy Optimization for Offline Reinforcement Learning

    Sep 30, 2026Seonvin Cho, Soohyun Choi, Songnam HongPolicy OptimizationOffline RL

  13. Do Better Goal Representations Improve Goal-Conditioned Reinforcement Learning?

    Sep 30, 2026Syed Nazmus Sakib, Abdul Monaf Chowdhury, Nafiul Haque +2Offline RLRepresentation Learning for RL

  14. In-Distribution Imagination for Model-Based Offline Reinforcement Learning

    Sep 29, 2026Mintae Kim, Koushil SreenathOffline RL

  15. HorizonFlow: Variable-Length Planning for Offline Goal-Conditioned RL

    Sep 29, 2026JunHyeok Oh, Zian Jang, Byung-Jun LeeHierarchical PlanningTrajectory Generation

  16. Deep Weighted Bellman Residual Minimization for Q∗Q^* Estimation

    Sep 28, 2026Lican Kang, Jerry Zhijian Yang, Cheng Yuan +1Off-Policy EvaluationValue Function Estimation

  17. Diffusion Subgoal Planning for Long-Horizon Offline Goal-Conditioned Reinforcement Learning

    Sep 28, 2026Hengrui Zhang, Yuhu Cheng, C. L. Philip Chen +1Diffusion-Based PlanningHierarchical RL

  18. QAMM: Adjoint MeanFlow Matching for Few-Step Offline Reinforcement Learning

    Sep 28, 2026Yuehu Gong, Shutong Ding, Mokai Pan +4Flow MatchingMeanFlow

  19. Q-learning Penalized Transformer for Safe Offline Reinforcement Learning

    Sep 28, 2026Shengchao Hu, Peng Wang, Jifeng Hu +5Reinforcement LearningTransformer-Based RL

  20. GTRL: Grounding Divide-and-Conquer Value Learning with Temporal Differences

    Sep 27, 2026Abdul Monaf Chowdhury, MD Sameer Iqbal Chowdhury, Shifat E Arman +1Reinforcement LearningTemporal-Difference Learning

  21. Trust Guided Decision Transformer

    Sep 25, 2026Chainesh Gautam, Raghuram Bharadwaj Diddigi, Chandramouli Kamanchi +3Transformer-Based RLDecision Transformer

  22. Learning from Mixed-Quality Deployment Experience for Robot Manipulation

    Sep 24, 2026Yangang Ren, Yujie Yan, Zirui Li +6Robot Policy LearningOffline RL

  23. Offline Reinforcement Learning for Distribution-Grid Protection

    Sep 21, 2026Julian Oelhaf, Alexander Luce, Christian Bergler +2Fault DetectionOffline RL

  24. Lifted Bellman Linear Programming for Offline Reinforcement Learning

    Sep 21, 2026Hyukjun Yang, Jongchan Park, Narim Jeong +1Reinforcement LearningOffline RL

  25. Learning Reliable Parking Policies via Offline Reinforcement Learning with Quantized Action Representations

    Sep 17, 2026Zewei Yang, Zengqi Peng, Jun MaAutonomous ParkingOffline RL

  26. Learning Multimodal One-step Flow Policy via Value-weighted Optimal Transport

    Sep 14, 2026Jaehun Shon, Jinha Choi, Jongwook Jeon +1Offline RL

  27. Performance, Efficiency and Collapse -- Advantages and Challenges in Offline Post-training of Code LLMs

    Sep 14, 2026Abhinav Anand, Sanjana Reddy Pachika, Shweta Verma +1RL for Code GenerationOffline RL