cs.AISep 30, 2026

Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding

Authors: Yifan Zhang, Qifan Zhang, Liang Zheng

Organizations: Central South University, Changsha, Hunan, China

Abstract

Exploratory reinforcement learning (RL) on an operating bus fleet is impractical,while policies trained only from historical data cannot acquire new experience. Hybrid Offline-and-Online (H2O) RL combines fixed target replay with simulator interaction, but the inexpensive online simulator can differ from the target in transition and event-duration dynamics. We study this cross-fidelity problem for multi-line bus holding and address a failure mode in which lower generalized passenger time coexists with incomplete passenger journeys.

Figures & tables

Appendix figures & tables3 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. Counterfactual Transport Flows for Offline Conservative Trajectory Refinement

    Jun 8, 2026Lena Krieger, Xuan Zhao, Zhuo Cao +3Model-Based Reinforcement LearningLong Refinement Trajectories

  2. Active Offline-to-Online Reinforcement Learning

    Jul 13, 2026Alper Kamil Bozkurt, Shangtong Zhang, Yuichi MotaiOffline Reinforcement LearningPolicy Evaluation

  3. Fully Offline Reinforcement Learning

    May 28, 2025Mattie Fellows, Clarisse Wibault, Uljad Berdica +3Model-Based Reinforcement LearningOffline Reinforcement Learning