Offline Reinforcement Learning

Latest papers 778

All topics
CardsList
  1. Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings

    Apr 24, 2026Peixi Wu, Ke Mei, Feipeng Ma +15Multimodal EmbeddingsRewrite

  2. Preserve Support, Not Correspondence: Dynamic Routing for Offline Reinforcement Learning

    Apr 24, 2026Zhancun Mu, Guangyu Zhao, Yiwu Zhong +1Offline Reinforcement LearningGoal-Conditioned Value Function

  3. When Policies Cannot Be Retrained: A Unified Closed-Form View of Post-Training Steering in Offline Reinforcement Learning

    Apr 23, 2026Elias Hossain, Mohammad Jahid Ibna Basher, Ivan Garibay +2Off-Policy LearningOffline Reinforcement Learning

  4. V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

    Apr 22, 2026Yubo Jiang, Yitong An, Xin Yang +7Multimodal ReasoningVisual Reasoning

  5. Maximum Entropy Semi-Supervised Inverse Reinforcement Learning

    Apr 22, 2026Julien Audiffren, Michal Valko, Alessandro Lazaric +1Offline Reinforcement Learning

  6. Efficient Reinforcement Learning using Linear Koopman Dynamics for Nonlinear Robotic Systems

    Apr 21, 2026Wenjian Hao, Yuxuan Fang, Zehui Lu +1Model-Based Reinforcement LearningKoopman Operator

  7. Visual Reasoning through Tool-supervised Reinforcement Learning

    Apr 21, 2026Qihua Dong, Gozde Sahin, Pei Wang +4Visual ReasoningRecent Vision-Language Models

  8. Safe Continual Reinforcement Learning in Non-stationary Environments

    Apr 21, 2026Austin Coursey, Abel Diaz-Gonzalez, Marcos Quinones-Grueiro +1Reinforcement Learning ControlSafety Constraints

  9. FASTER: Value-Guided Sampling for Fast RL

    Apr 21, 2026Perry Dong, Alexander Swerdlow, Dorsa Sadigh +1Diffusion-Based Reinforcement Learning MethodsOffline Reinforcement Learning

  10. Pause or Fabricate? Training Language Models for Grounded Reasoning

    Apr 21, 2026Yiwen Qiu, Linjuan Wu, Yizhou Liu +9LLM Reasoning StrategiesTool-Grounded Reasoning

  11. CXRMate-2: Structured Multimodal Temporal Embeddings and Tractable Reinforcement Learning for Clinically Acceptable Chest X-ray Radiology Report Generation

    Apr 21, 2026Aaron Nicolson, Elizabeth J. Cooper, Hwan-Jin Yoon +7Chest X-RayRadiology Report Generation

  12. Bounded Ratio Reinforcement Learning

    Apr 20, 2026Yunke Ao, Le Chen, Bruce D. Lee +5Proximal Policy OptimizationOffline Reinforcement Learning

  13. Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks

    Apr 20, 2026Md Rysul Kabir, Zoran TiganjLarge Language Model JailbreaksJailbreaks

  14. StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning

    Apr 20, 2026Daoyu Wang, Qingchuan Li, Mingyue Cheng +4Agentic Reinforcement LearningFrictive Policy Optimization

  15. LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent

    Apr 20, 2026Wanli Li, Bince Qu, Bo Pan +5Agentic Reinforcement LearningDeep Research

  16. Web-Gewu: A Browser-Based Interactive Playground for Robot Reinforcement Learning

    Apr 18, 2026Kaixuan Chen, Linqi YeScalable Robot LearningEmbodied Artificial Intelligence

  17. NaviFormer: A Deep Reinforcement Learning Transformer-like Model to Holistically Solve the Navigation Problem

    Apr 18, 2026Daniel Fuertes, Andrea Cavallaro, Carlos R. del-Blanco +2Path PlanningOffline Reinforcement Learning

  18. EasyVideoR1: Easier RL for Video Understanding

    Apr 18, 2026Chuanyu Qin, Chenxu Yang, Qingyi Si +6Video UnderstandingOffline Reinforcement Learning

  19. Debate as Reward: A Multi-Agent Reward System for Scientific Ideation via RL Post-Training

    Apr 17, 2026Moein Salimi, Babak Hosseini Mohtasham, Amin Aghakasiri +6Scientific IdeationLarge Language Model Reinforcement Learning

  20. DARLING: Detection Augmented Reinforcement Learning with Non-Stationary Guarantees

    Apr 17, 2026Argyrios Gerogiannis, Yu-Han Huang, Venugopal V. VeeravalliModel-Free Reinforcement LearningOffline Reinforcement Learning

  21. Safe Deep Reinforcement Learning for Building Heating Control and Demand-side Flexibility

    Apr 17, 2026Colin Jüni, Mina Montazeri, Yi Guo +3Hvac ControlDemand Response

  22. Fuzzy Logic Theory-based Adaptive Reward Shaping for Robust Reinforcement Learning (FARS)

    Apr 17, 2026Hürkan Şahin, Van Huyen Dang, Erdi Sayar +2Potential-Based Reward ShapingOffline Reinforcement Learning

  23. Flexible Empowerment at Reasoning with Extended Best-of-N Sampling

    Apr 17, 2026Taisuke KobayashiStochastic ExplorationOffline Reinforcement Learning

  24. RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework

    Apr 16, 2026Hao Gao, Shaoyu Chen, Yifan Zhu +4Diffusion PlanningAutonomous Driving

  25. RL-STPA: Adapting System-Theoretic Hazard Analysis for Safety-Critical Reinforcement Learning

    Apr 16, 2026Steven A. Senczyszyn, Timothy C. Havens, Nathaniel Rice +3HazardOffline Reinforcement Learning

  26. WavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-Training

    Apr 16, 2026Yifu Chen, Shengpeng Ji, Qian Chen +9Speech Language ModelsPreference Alignment Learning

  27. Mean Flow Policy Optimization

    Apr 16, 2026Xiaoyi Dong, Xi Sheryl Zhang, Jian ChengFlow PoliciesDiffusion-Based Reinforcement Learning Methods

  28. TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training

    Apr 10, 2026Chenhao Ye, Huaizheng Zhang, Mingcong Han +11Large Language Model Reinforcement LearningOffline Reinforcement Learning

  29. Less Data Approximates More: Earning Faithful Confidence in High-Stakes Domains

    Apr 9, 2026Haokai Ma, Lee Yan Zhen, Gang Yang +4Supervised FinetuningFaithfulness

  30. RefineRL: Advancing Competitive Programming with Self-Refinement Reinforcement Learning

    Apr 1, 2026Shaopeng Fu, Xingxing Zhang, Li Dong +1Large Language Model Reinforcement LearningLLM Reasoning Strategies

  31. TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration

    Mar 29, 2026Guoli Jia, Yisheng Zhang, Haote Hu +11Image RestorationOffline Reinforcement Learning

  32. End-to-End Efficient RL for Linear Bellman Complete MDPs with Deterministic Transitions

    Mar 24, 2026Zakaria Mhammedi, Alexander Rakhlin, Nneka OkoloMarkov Decision ProcessesBellman Equation

  33. Learning to Remember: Attentive Reinforcement Learning for Edge Serverless Autoscaling

    Mar 21, 2026Faraz Shaikh, Gianluca Reali, Mauro FemminellaEdge PlatformsRate Scaling

  34. SutureFormer: Learning Surgical Trajectories via Goal-conditioned Offline RL in Pixel Space

    Mar 19, 2026Huanrong Liu, Chunlin Tian, Tongyu Jia +8Surgical RobotsImitation Learning

  35. RL unknotter, hard unknots and unknotting number

    Mar 9, 2026Anne Dranowski, Yura Kabkov, Daniel TubbenhauerOffline Reinforcement LearningUpper Bounds

  36. Learning When to Trust in Contextual Social Bandits

    Mar 9, 2026Majid Ghasemi, Mark CrowleyContextual Bandit FrameworkAI Trustworthiness

  37. Relating Reinforcement Learning to Dynamic Programming-Based Planning

    Mar 8, 2026Filip V. Georgiev, Kalle G. Timperi, Başak Sakçak +1Offline Reinforcement LearningSequential Decision Making

  38. Expert Knowledge-driven Reinforcement Learning for Autonomous Racing via Trajectory Guidance and Dynamics Constraints

    Mar 6, 2026Bo Leng, Weiqi Zhang, Zhuoren Li +4Autonomous RacingAutonomous Driving

  39. Latent Policy Steering through One-Step Flow Policies

    Mar 5, 2026Hokyun Im, Andrey Kolobov, Jianlong Fu +1Model-Based Reinforcement LearningFlow Policies

  40. EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models

    Feb 27, 2026Yiyang Fang, Wenke Huang, Pei Fu +5Multimodal Large Language ModelsEmotion Recognition

  41. A Model-Free Universal AI

    Feb 26, 2026Yegon Kim, Juho LeeModel-FreeOffline Reinforcement Learning

  42. TabSieve: Explicit In-Table Evidence Selection for Tabular Prediction

    Feb 12, 2026Yongyao Wang, Ziqi Miao, Lu Yang +4Tabular LearningOffline Reinforcement Learning

  43. High-Speed Vision-Based Flight in Clutter with Safety-Shielded Reinforcement Learning

    Feb 9, 2026Jiarui Zhang, Chengyong Lei, Chengjiang Dai +4QuadrotorObstacle Avoidance

  44. rePIRL: Learn PRM with Inverse RL for LLM Reasoning

    Feb 8, 2026Xian Wu, Kaijie Zhu, Ying Zhang +2Process Reward ModelLarge Language Model Reinforcement Learning

  45. An evidence-guided reinforcement learning method to improve psychiatric reasoning in small language models

    Feb 6, 2026Xinxin Lin, Guangxin Dai, Yi Zhong +25Clinical Reasoning TrainingMental Health

  46. CodeScaler: Scaling Code LLM Training and Test-Time Inference via Reward Models

    Feb 4, 2026Xiao Zhu, Xinyu Zhou, Boyu Zhu +5Test-Time ScalingLarge Language Model Training

  47. Agile Reinforcement Learning through Separable Neural Architecture and Applications

    Jan 30, 2026Rajib Mostakim, Reza T. Batley, Sourav SahaOffline Reinforcement LearningDeep Learning Architectures

  48. Offline Reinforcement Learning of High-Quality Behaviors Under Robust Style Alignment

    Jan 30, 2026Mathieu Petitbois, Rémy Portelas, Sylvain LamprierGoal-Conditioned Reinforcement LearningGoal-Conditioned Value Function

  49. Tracking Drift: Variation-Aware Entropy Scheduling for Non-Stationary Reinforcement Learning

    Jan 27, 2026Tongxi Wang, Zhuoyang Xia, Xinran Chen +1Entropy Regularized Reinforcement LearningOffline Reinforcement Learning

  50. Reversible Simplex Supervision with Post-Action Debt Accounting for Goal-Reaching RL

    Jan 27, 2026Mehdi Heydari Shahna, Joongheon Kim, Jouni MattilaOffline Reinforcement Learning

  51. Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability

    Jan 26, 2026Shobhita Sundaram, John Quan, Ariel Kwiatkowski +3Curriculum Reinforcement LearningSelf-Play

  52. ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule

    Jan 26, 2026Yilie Huang, Wenpin Tang, Xunyu ZhouTimestepDiffusion Sampling