Offline Reinforcement Learning

Latest papers 778

All topics
CardsList
  1. FERPO: Forward Entropy-Regularized Policy Optimization

    Oct 1, 2026Sebastian Sanokowski, Alireza Sarmadi, Majid KhadivEntropy Regularized Reinforcement LearningOffline Reinforcement Learning

  2. Bellman Meets Lyapunov: Unsupervised Reinforcement Learning via Mastering Chaos

    Oct 1, 2026Tristan Shah, Wooyoung Chung, Volodomyr Makarenko +2Offline Reinforcement LearningReward Functions

  3. Token-Level Video Reinforcement Learning

    Oct 1, 2026Yifan Wang, Gordon Guocheng Qian, Yanyu Li +2Frozen Vision-Language ModelsOffline Reinforcement Learning

  4. Q-Learning for Reachability in MEC-Free MDPs

    Oct 1, 2026Lu-Chin Chang, Suguman BansalQ-LearningMarkov Decision Processes

  5. Function-Structured Reinforcement Learning with Executable Verifiers for Mathematical Reasoning

    Oct 1, 2026Zihan Liu, Xurong XieMathematical ReasoningReinforcement Learning With Verifiable Reward

  6. Continual Reinforcement Learning with Neuroevolution

    Oct 1, 2026Eleni Nisioti, Andrea Cossu, Kathrin Korte +1NeuroevolutionPlasticity

  7. Towards Optimal Policy Improvement

    Oct 1, 2026Yaniv Oren, Viliam Vadocz, Wiktor Zabka +7Boltzmann PoliciesMarkov Decision Processes

  8. Flow Matching Reinforcement for 3D Mesh Generation via Dynamic Homing Optimization

    Oct 1, 2026Zhen Zhou, Zhiwei Ning, Puhua Jiang +6MeshesGeometric Guidance

  9. Does Scaling Reinforcement Learning Really Require More Training?

    Oct 1, 2026Bangji Yang, Jiajun Fan, Hongbo Ma +2Offline Reinforcement LearningSequential Scaling

  10. eRLT: Efficient VLA Reinforcement Learning via Action-Relevant Token Routing

    Oct 1, 2026Dehao Huang, Jianbang Liu, Jianpan Gao +7Diffusion-Based Vision-Language-ActionsOffline Reinforcement Learning

  11. Scalable Multi-Task Inverse Reinforcement Learning

    Sep 30, 2026Allen Tran, Jia Wan, Nathan Kallus +1Multi-Turn Reinforcement LearningOffline Reinforcement Learning

  12. ALER: Adaptive Learnable Experience Rewriting for Reinforcement Learning

    Sep 30, 2026Oleg Shchendrigin, Egor Cherepanov, Aleksandr I. Panov +1Prioritized Experience ReplayOffline Reinforcement Learning

  13. Reinforcement Learning-Guided Graph Transformations for SpTRSV Optimization

    Sep 30, 2026Buse YılmazMultiplex Graph TransformersGraph Edge Sparsification

  14. Role-Adaptive Policy Optimization for Offline Reinforcement Learning

    Sep 30, 2026Seonvin Cho, Soohyun Choi, Songnam HongFrictive Policy OptimizationOffline Reinforcement Learning

  15. CATCH: A Controllable Analysis Testbed for Reward Hacking in Coding RL

    Sep 30, 2026Shouli Wang, Yanfeng Jia, Zhihao Ou +6Reinforcement Learning With Verifiable RewardOffline Reinforcement Learning

  16. MatrixReward: Reward from Rubric Matrix for Open-Ended Generation

    Sep 30, 2026Zihan Shen, Qi Liu, Zixuan Yang +4Reward SignalReasoning Benchmark

  17. CAST: Causal Advantage-Structured Training with Spatially Grounded Compositional Rewards for Diffusion Models

    Sep 30, 2026Shu Yu, Chaochao LuDiffusion ModelsImage Generation

  18. Aligning Thoughts with Answers: Probability Rewards to Tame Thinking Drift

    Sep 30, 2026Pengzhan Sun, Shiu-hong Kao, Shijie Li +4Weak Visual GroundingOffline Reinforcement Learning

  19. Loop-Free Inverse Reinforcement Learning via Sequential Value Recovery with Q-Score Matching

    Sep 30, 2026Yang chen, Yitan Zhang, Michael Witbrock +1Offline Reinforcement LearningValue Functions

  20. Robust Risk-Sensitive Reinforcement Learning from Corrupted Human Feedback

    Sep 30, 2026Xinyi Ni, Lifeng LaiReinforcement Learning From Human FeedbackConditional-Value-At-Risk

  21. PRICE the Action Chunks: Physical Relational Credit Assignment for Embodied Reinforcement Learning

    Sep 30, 2026Yangang Zou, Jiajun Lu, Weitao Zhou +6Offline Reinforcement LearningCredit Assignment

  22. DODGER: Safety-Guided Reinforcement Learning for Robot Navigation Among Dynamic Obstacles

    Sep 30, 2026Sanghyuk Park, Kwanwoo Lee, Taekyung Kim +2Obstacle AvoidanceRobot Navigation

  23. Reinforcement Learning with Complex (valued) Memories

    Sep 29, 2026Sathya Kamesh Bhethanabhotla, Efstratios Gavves, André BiedenkappRecurrent Neural NetworksOffline Reinforcement Learning

  24. Learning to Prove, Not Just to Answer: Reinforcement Learning from Formal Verification for Natural-Language Logical Reasoning

    Sep 29, 2026Qili Zhang, Qianren Mao, Hanze Cai +11LLM Reasoning StrategiesReasoning Benchmark

  25. ReF-HIL: Shaping the Critic around Human Action Neighborhoods for Efficient Human-in-the-Loop Reinforcement Learning

    Sep 29, 2026Shaoyin Luo, Song Wang, Shibo Xia +5Reinforcement Learning From Human FeedbackHuman-In-The-Loop

  26. Physics-Informed Multi-Agent Coordination for Hospital Patient Flow Optimization

    Sep 29, 2026Guoqing Zhang, Rafik Hadfi, Takayuki ItoMulti-Agent CoordinationQueue Control

  27. Inducing Process Supervision from Outcome-Only Reinforcement Learning

    Sep 29, 2026Shengda Fan, Xin Cong, Zhong Zhang +2Process Reward ModelProcess-Level Supervision

  28. Multi-Channel Mitigation of Source-Trust Shortcuts in Fact-Checking RL Agents

    Sep 29, 2026Jianchang Su, Yiwei Yang, Wei ZhangFact-CheckingAI Trustworthiness

  29. DORA: Divergence-Oriented Data-Relay Algorithm for Partially Connected Robot Teams

    Sep 28, 2026Jonathan Diller, Fernando Cladera, Camillo Jose Taylor +1Multi-UavHuman-Centric Mission Planning

  30. StructRL: Online Structured Reinforcement Learning for Long-Horizon Vision-Language-Action Tasks

    Sep 28, 2026Ziyi Yin, Sangmin Woo, Kang Zhou +4Long-Horizon ManipulationOffline Reinforcement Learning

  31. Fully Decentralized and Safety-Aware Multi-Agent Reinforcement Learning for Control on Networks

    Sep 28, 2026Theodore Rogalski, Shirantha WelikalaMulti-Agent Reinforcement LearningOffline Reinforcement Learning

  32. ChronoSRL: Temporal Geometry for Self-Supervised Reinforcement Learning

    Sep 28, 2026Nico Bohlinger, Jan PetersGoal-Conditioned Reinforcement LearningOffline Reinforcement Learning

  33. X-Reset: Scaling Object-Centric Reinforcement Learning via Cross-Embodiment Resets

    Sep 28, 2026Prithwish Dan, Chenyang Ma, Wei ZhanRobotic Manipulation PoliciesOffline Reinforcement Learning

  34. An RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning

    Sep 28, 2026Shangzhe Li, Yuxiao Yang, Tianrun Yu +4LLM Reasoning StrategiesOffline Reinforcement Learning

  35. Scalable In-Context Reinforcement Learning with Recurrent Algorithm Distillation

    Sep 28, 2026Yuanqing Ma, Zhenrui Zheng, Chenjun XiaoOffline Reinforcement Learning

  36. PIVOT: Pivot-Aware On Policy Self Distillation for Multi-Turn VLM Agents

    Sep 28, 2026Jiazhou Zhou, Hu Zhou, Yucheng Chen +3Reinforcement Learning With Verifiable RewardOffline Reinforcement Learning

  37. SIPO: Selective-Inference Policy Optimization for Tree-Structured Agentic RL

    Sep 28, 2026Zenghuang Fu, Ningqi Chen, Mingda Jia +10Frictive Policy OptimizationAgentic Reinforcement Learning

  38. Unified Trajectory Matching Policy Optimization: Diverse T2I Generation and VLA Generalization

    Sep 28, 2026Zhiyuan Ma, Jiaming Li, Lingzhen Li +7Text-To-ImageOffline Reinforcement Learning

  39. Summarize Before Grounding: Query-Guided Chunk Condensation for Long-Video Temporal Grounding

    Sep 28, 2026Nanxing Hu, Xiaoyue Duan, Qiwei Yan +3Video Temporal GroundingTemporal Grounding

  40. Deep Weighted Bellman Residual Minimization for Q∗Q^* Estimation

    Sep 28, 2026Lican Kang, Jerry Zhijian Yang, Cheng Yuan +1Offline Reinforcement LearningBellman Equation

  41. Verifying Neural Networks with Reinforcement Learning

    Sep 28, 2026Hai Duong, Thanh Le, ThanhVu NguyenNeural Network VerificationReinforcement Learning With Verifiable Reward

  42. FlexLoop: Depth-Elastic Looped Policies for Adaptive Test-Time Computation in Deep RL

    Sep 28, 2026Xun Wang, Ruishuo Chen, Yu Chen +2Offline Reinforcement LearningLoop

  43. Model-Informed Safe Reinforcement Learning for Bipedal Locomotion via Step-to-Step Prediction

    Sep 28, 2026Victor Paredes, Ayonga HereidScalable Robot LearningGait Dynamics

  44. DORA: Dynamic Online Reinforcement Agent for Token Pruning in Vision Transformers

    Sep 28, 2026Kaixuan He, Song Chen, Yi KangVisual Token PruningVision Transformer

  45. Evolving Support Priorities in Empathetic Reinforcement Learning

    Sep 28, 2026Pengyu Huang, Zhiyuan Han, Wenwen Tong +6EmpathyReinforcement Learning From Human Feedback

  46. Evolution of fairness in multi-objective reinforcement learning framework

    Sep 28, 2026Jingyi Zhang, Xin Ou, Guozhong Zheng +3Game TheoryMulti-Objective Reinforcement Learning

  47. Counterfactual Rollout Replay: Forkable Environments as Free Process Rewards for Software Engineering Agents

    Sep 27, 2026Yuanhao Li, Hongbo Wang, Xuhong Chen +2Counterfactual LearningSoftware Engineering

  48. QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents

    Sep 27, 2026Weiqi Wang, Yuxin Zhou, Mouxiang Chen +9Large Language Model Reinforcement LearningOffline Reinforcement Learning

  49. Reliable Replay through Spatial Coherence in Online Continual Learning

    Sep 27, 2026Haixiang Sun, Jiefu Zhang, Yinghao He +4Prioritized Experience ReplayReplay-Based Continual Learning

  50. Climbing the Hill: Prompt Injection Red-Teaming Against Frontier Models with Curriculum Reinforcement Learning

    Sep 27, 2026Chenlong Yin, Xiaolong Jin, Wei Zou +2Attacker Large Language ModelRed-Teaming

  51. Temporal Gradient Inversion for Private Trajectory Reconstruction in Embodied Reinforcement Learning

    Sep 24, 2026Sudip Bhujel, Shanghao Shi, Ruiquan Huang +2Gradient-Based AttacksOffline Reinforcement Learning

  52. PoEM: Predicting RL Outcomes from Existing Policies

    Sep 24, 2026Kimia Hamidieh, Giannis Daras, Antonio TorralbaOffline Reinforcement LearningPoetry

  53. MQSS-Selector: RL-Guided Pass Selection for an MLIR Compilation Pipeline

    Sep 24, 2026Andre Youssefi, Ercüment Kaya, Minh Chung +3Offline Reinforcement LearningSoftware

  54. Rufus-Air: An Open LLM Post-Training Recipe

    Sep 24, 2026Chia-Yuan Chang, Renyuan Cheng, Rui Feng +19Post-TrainingOffline Reinforcement Learning

  55. Right Choice of Classification Algorithms Based on Reinforcement Learning for Prediction of Non-Alcoholic Fatty Liver

    Sep 24, 2026Hasan Samadbin, Arman DaliriCholangiocarcinomaClassifier