Offline Reinforcement Learning

Latest papers 778

All topics
CardsList
  1. PEARL: Self-Evolving Assistant for Time Management with Reinforcement Learning

    Jan 17, 2026Bingxuan Li, Jeonghwan Kim, Cheng Qian +4ScheduleAssistant

  2. Agile and Generalized Legged Locomotion via Attention-Based Neural Map Encoding

    Jan 13, 2026Chong Zhang, Victor Klemm, Fan Yang +1Agile LocomotionSensorimotor Experience

  3. Precision autotuning for linear solvers via contextual bandit-based RL

    Jan 2, 2026Erin Carson, Xinye ChenSolver IterationsFull-Precision Performance

  4. Soft Fitted Q-Iteration without Bellman Completeness: Occupancy Reweighting and Temperature Annealing

    Dec 30, 2025Lars van der Laan, Nathan KallusEntropy Regularized Reinforcement LearningBoltzmann Policies

  5. Meta-RL with Bayesian Linear Task Models

    Dec 24, 2025Jingyang You, Hanna KurniawatiOffline Reinforcement LearningVariational Inference

  6. The HydroGym Reinforcement Learning Platform for Fluid Dynamics

    Dec 19, 2025Christian Lagemann, Sajeda Mokbel, Miro Gondrum +18Fluid DynamicsFluid Controls

  7. Attention Trajectories as a Diagnostic Axis for Deep Reinforcement Learning

    Nov 25, 2025Charlotte Beylier, Hannah Selder, Arthur Fleig +2Offline Reinforcement LearningSaliency

  8. Reinforcement Learning to Initialize Newton-Raphson for AC Power Flow with Quantum Annealing-Based Environment Updates

    Nov 25, 2025Zeynab Kaseb, Matthias Moller, Lindsay Spoor +4Optimal Power FlowQuantum Annealing

  9. SEBA: Sample-Efficient Black-Box Attacks on Visual Reinforcement Learning

    Nov 12, 2025Tairan Huang, Yulin Jin, Junxu Liu +2Black-Box Adversarial AttacksOffline Reinforcement Learning

  10. A Quantitative Comparison of Centralised and Distributed Reinforcement Learning-Based Control for Soft Robotic Arms

    Nov 4, 2025Linxin Hou, Qirui Wu, Zhihang Qin +3Multi-Agent Reinforcement LearningSoft Robotics

  11. Zero-Human Demonstration End-to-end Autonomous Driving with Trajectory Scorer

    Oct 28, 2025Zhenxin Li, Nadine Chang, Wenhao Yao +9Causality-Aware End-To-End Autonomous DrivingAutonomous Driving

  12. CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts

    Oct 10, 2025Jiuheng Lin, Cong Jiang, Zirui Wu +2Offline Reinforcement Learning

  13. TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance

    Oct 9, 2025Jianhui Yang, Yiming Jin, Pengkun Jiao +6RelevanceAgentic Commerce

  14. Finite-Time Convergence of Single-Trajectory Chi-Square Robust Q-Learning With Linear Function Approximation

    Oct 2, 2025Saptarshi Mandal, Yashaswini Murthy, R. SrikantQ-LearningOffline Reinforcement Learning

  15. Reward function compression facilitates goal-dependent reinforcement learning

    Sep 8, 2025Gaia Molinaro, Anne G. E. CollinsGoal-Conditioned Reinforcement LearningReward Functions

  16. ReST-RL: Reinforcing LLM Reasoning through Unified Self-Training and Value-Guided Search

    Aug 27, 2025Sining Zhoubian, Dan Zhang, Jie TangLLM Reasoning StrategiesLarge Language Model Reinforcement Learning

  17. Integrated Noise and Safety Management in UAM via A Unified Reinforcement Learning Framework

    Aug 22, 2025Surya Murthy, Zhenyu Gao, John-Paul Clarke +1Multi-UavAir Traffic Control

  18. ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMs

    Aug 19, 2025Hongxin Ding, Baixiang Huang, Yue Fang +8Offline Reinforcement Learning

  19. Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts

    Aug 13, 2025Maxime Heuillet, Yufei Cui, Boxing Chen +2Mathematical Reasoning BenchmarksLarge Language Model Fine-Tuning

  20. PERRY: Policy Evaluation with Confidence Intervals using Auxiliary Data

    Jul 26, 2025Aishwarya Mandyam, Jason Meng, Ge Gao +4Policy EvaluationConfidence Intervals

  21. RAD: Retrieval High-quality Demonstrations to Enhance Decision-making

    Jul 21, 2025Lu Guo, Yixiang Shan, Zhengbang Zhu +5Model-Based Reinforcement LearningOffline Reinforcement Learning

  22. A Technical Survey of Reinforcement Learning Techniques for Large Language Models

    Jul 5, 2025Saksham Sahai Srivastava, Vaneet AggarwalLarge Language Model Reinforcement LearningOffline Reinforcement Learning

  23. Discrete Compositional Generation via General Soft Operators and Robust Reinforcement Learning

    Jun 20, 2025Marco Jiralerspong, Esther Derman, Danilo Vucetic +5Kullback-Leibler RegularizationRejection Sampling

  24. Adaptive Reinforcement Learning for Unobservable Random Delays

    Jun 17, 2025John Wikman, Alexandre Proutiere, David BromanOffline Reinforcement LearningMujoco

  25. ProteinZero: Self-Improving Protein Generation via Online Reinforcement Learning

    Jun 9, 2025Ziwen Wang, Jiajun Fan, Ruihan Guo +3Protein DesignProtein

  26. SafeOR-Gym: A Benchmark Suite for Safe Reinforcement Learning Algorithms on Practical Operations Research Problems

    Jun 2, 2025Asha Ramanujam, Adam Elyoumi, Hao Chen +5Safety ConstraintsOperations Research

  27. Normalizing Flows are Capable Models for Continuous Control

    May 29, 2025Raj Ghugare, Benjamin EysenbachNormalizing FlowsOffline Reinforcement Learning

  28. Fully Offline Reinforcement Learning

    May 28, 2025Mattie Fellows, Clarisse Wibault, Uljad Berdica +3Model-Based Reinforcement LearningOffline Reinforcement Learning

  29. Fox in the Henhouse: Supply-Chain Backdoor Attacks Against Reinforcement Learning

    May 26, 2025Shijie Liu, Andrew C. Cullen, Paul Montague +2Offline Reinforcement LearningKernel-Resident Tool Governance Gateway

  30. Model-Free Robust Average-Reward Reinforcement Learning with Sample Complexity Analysis

    May 18, 2025Zachary Roch, George Atia, Yue WangModel-FreeOffline Reinforcement Learning

  31. HERB: Human-augmented Efficient Reinforcement learning for Bin-packing

    Apr 23, 2025Gojko Perovic, Nuno Ferreira Duarte, Atabak Dehban +3Scalable Robot LearningOffline Reinforcement Learning

  32. Towards More Efficient, Robust, Instance-adaptive, and Generalizable Sequential Decision making

    Apr 12, 2025Zhiyong WangSequential Decision MakingOffline Reinforcement Learning

  33. A Survey of Reinforcement Learning-Based Motion Planning for Autonomous Driving: Lessons Learned from a Driving Task Perspective

    Mar 31, 2025Zhuoren Li, Guizhe Jin, Ran Yu +8Autonomous DrivingMotion Planning

  34. Distributionally Robust Reinforcement Learning with Human Feedback

    Mar 1, 2025Debmalya Mandal, Paulius Sasnauskas, Goran RadanovicReinforcement Learning From Human FeedbackDistributional Reinforcement Learning

  35. Dynamic Optimizations of LLM Ensembles with Two-Stage Reinforcement Learning Agents

    Feb 6, 2025Selim Furkan Tekin, Gaowen Liu, Ramana Rao Kompella +1Large Language Model Reinforcement LearningEnsemble

  36. RL-STaR: Theoretical Analysis of Reinforcement Learning Frameworks for Self-Taught Reasoner

    Oct 31, 2024Fu-Chieh Chang, Yu-Ting Lee, Hui-Ying Shih +2Large Language Model Reinforcement LearningLLM Reasoning Strategies

  37. Streaming Deep Reinforcement Learning Finally Works

    Oct 18, 2024Mohamed Elsayed, Elena Sorina Lupu, Gautham Vasan +1Offline Reinforcement LearningQ-Learning

  38. A Survey on Reinforcement Learning Applications in SLAM

    Aug 26, 2024Mohammad Dehghani Tezerjani, Mohammad Khoshnazar, Mohammadhamed Tangestanizadeh +2Simultaneous Localization And MappingRobot Navigation

  39. ProSpec RL: Plan Ahead, then Execute

    Jul 31, 2024Liangliang Liu, Yi Guan, BoRan Wang +5Model-Free Reinforcement LearningOffline Reinforcement Learning

  40. Open-Vocabulary Object-Goal Navigation by Generalizing Semantic Mapping with Dense CLIP

    Jul 12, 2024Meng Wei, Chenyang Wan, Tai Wang +6Vision-Language NavigationOpen-Vocabulary

  41. Lipschitz-Regularized Critics Lead to Policy Robustness Against Transition Dynamics Uncertainty

    Apr 22, 2024Xulin Chen, Ruipeng Liu, Zhenyu Gan +1Proximal Policy OptimizationOffline Reinforcement Learning

  42. Distributionally Robust Reinforcement Learning with Interactive Data Collection: Fundamental Hardness and Near-Optimal Algorithms

    Apr 4, 2024Miao Lu, Han Zhong, Tong Zhang +1Distributional Reinforcement LearningOffline Reinforcement Learning

  43. Fading Expert Guidance: Bridging Model-Based and Learning-Based Control for Abortable Autonomous Overtaking

    Aug 18, 2023Jinxiong Lu, Gokhan Alcan, Ville KyrkiReinforcement Learning ControlRobust Trajectory

  44. Robust Recurrent Reinforcement Learning under Evolving Hidden Disturbances with Application to Rover Wheel Slip

    Jul 29, 2023Saki Omi, Hyo-Sang Shin, Namhoon Cho +2Offline Reinforcement LearningWheel

  45. Reinforcement Learning with Temporal-Logic-Based Causal Diagrams

    Jun 23, 2023Yash Paliwal, Rajarshi Roy, Jean-Raphaël Gaglione +5Offline Reinforcement LearningLinear Temporal Logics

  46. Discovering Temporal Structure: An Overview of Hierarchical Reinforcement Learning

    Date pendingMartin Klissarov, Akhil Bagaria, Ziyan Luo +3Hierarchical Reinforcement LearningOffline Reinforcement Learning

  47. CMoE: Contrastive Mixture of Experts for Motion Control and Terrain Adaptation of Humanoid Robots

    Date pendingShihao Ma, Hongjin Chen, Zijun Xu +6Full-Body Humanoid ControlTerrain

  48. UBCL: A Reinforcement Learning Framework for Controllable and Diverse Player Behaviors

    Date pendingAtahan Cilan, Atay ÖzgövdeBehavior CloningOffline Reinforcement Learning

  49. CoSkill: Joint Reinforcement Learning of Reasoning and Meta-Skill Agents for Hierarchical Skill Evolution

    Date pendingJinyuan Feng, Dongmin Li, Yiqun Chen +4Self-Evolving Skill LibrariesReusable Agent Skills

  50. Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning

    Date pendingAnthony GX-Chen, Ankit Anand, Gheorghe Comanici +7Reward FunctionsOffline Reinforcement Learning