Hierarchical Time-aware Bootstrapping for Off-Policy Subgoal Value Learning
Organizations: Institute of Automation Chinese Academy of Sciences
Abstract
Off-policy hierarchical reinforcement learning must estimate the values of high-level decisions while the low-level policy changes. HIRO adapts replay data through subgoal relabeling, but after a label change, the value update targets the relabeled subgoal instead of the subgoal the high-level policy originally needed to update. We propose Hierarchical Time-aware Bootstrapping (HTB), which evaluates specified subgoals under the current low-level policy while retaining accumulated task rewards. Remaining execution time distinguishes subgoal continuation from a new high-level decision. Together with primitive-action conditioning, it enables off-policy Bellman updates based on the stationary environment transition law. HTB combines these one-step updates with multi-step suffix returns and truncated relabeling, reducing dependence on intermediate value estimates. A shared value component supports learning across actions, while nonnegative residuals constrain upward corrections relative to that component. At a fixed mixture weight of 0.95, HTB achieves 32.8% AntFall success versus 9.6% for matched local HIRO over five paired seeds at 10M environment steps. Ablations identify contributions from recursive continuation and mixed supervision; fixed-policy tests show more accurate predictions for actions whose returns were excluded from fitting.
Figures & tables
| Variant | One-step subgoal | Next residual | Output / target |
|---|---|---|---|
| HTB | Replay | Included | Nonnegative / clipped |
| No next residual | Replay | Omitted | Nonnegative / clipped |
| Signed residual | Replay | Omitted | Signed / signed |
| Policy subgoal | Current proposal | Omitted | Nonnegative / clipped |
| Separate test trajectories | Actions excluded from fitting | |||
|---|---|---|---|---|
| Task | Direct- | Shared | Direct- | Shared |
| Reacher-v0 dense | ||||
| Reacher-v1 sparse | ||||
Appendix figures & tables28 assets
Supplementary material from the paper’s appendix.
Appendix
| Setting | Value |
|---|---|
| Environment steps | |
| High-level period / update interval | / primitive steps |
| Batch size (both levels) | |
| Replay capacity (both levels) | transitions each |
| Actor learning rate (both levels) | |
| Critic learning rate (both levels) |
| Analysis set | Settings | Wins | Mean gain |
|---|---|---|---|
| Interior mixing weights | 64 | 60 | +26.82 |
| Full grid, deduplicated | 84 | 68 | +20.88 |
| Full logical grid | 88 | 71 | +20.49 |
| Single-setting exclusion, logical grid | 87 | 71 | +20.74 |
| Single-setting exclusion, deduplicated | 83 | 68 | +21.14 |
| Setting | Seed | Correction | Steps (millions) | Original | Corrected | Current |
|---|---|---|---|---|---|---|
| Rv0/s/Signed | 781 | yes | 0.95–1.00 | 0.316 | 0.315 | 0.322 |
| Rv0/s/Signed | 784 | yes | 0.70–0.75 | 0.333 | 0.327 | 0.336 |
| Rv0/s/Signed | 781 | no | 0.90–1.00 | 0.214 | 0.205 | 0.199 |
| Rv0/s/Signed | 784 | no | 0.90–1.00 | 0.950 | 0.945 | 0.989 |
| Rv1/d/HTB | 783 | yes | 0.95–1.00 | 3.366 | 3.324 | 3.394 |
| Rv1/s/HTB | 779 | yes | 0.95–1.00 | 2.667 | 0.789 | 1.080 |
| Env. | Rule | return | success | |
|---|---|---|---|---|
| Fall | No next residual | 0 | -971.5 | +0.0 |
| Fall | No next residual | 0.6 | +5938.8 | +0.0 |
| Fall | No next residual | 0.9 | -767.3 | -9.2 |
| Fall | No next residual | 0.95 | +2850.9 | +14.4 |
| Fall | No next residual | 0.99 | +4225.6 | +13.2 |
| Fall | No next residual | 1 | -309.2 | -8.8 |
| Task | Correction | No correction | Difference (pp) |
|---|---|---|---|
| Reacher-v0 / dense | 60.00 | 88.13 | +28.12 |
| Reacher-v1 / sparse | 26.00 | 81.63 | +55.62 |
| Environment | Reward | HIRO | Multi-step only | HTB/.95 |
|---|---|---|---|---|
| Reacher-v0 | dense | |||
| Reacher-v0 | sparse | |||
| Reacher-v1 | dense | |||
| Reacher-v1 | sparse | |||
| Maze-v1 | dense | — | ||
| Maze-v1 | sparse | — |
| Contrast | Tasks | Corr. | Mean difference | |
|---|---|---|---|---|
| Recursive nonrecursive | Maze | off | 16 | -0.1 |
| Recursive nonrecursive | Push/Fall | off | 8 | -151.3 |
| Recursive nonrecursive | Push/Fall | on | 8 | 1136.0 |
| Recursive nonrecursive | Reacher | off | 16 | -0.1 |
| Recursive nonrecursive | Reacher | on | 16 | 2.8 |
| Nonnegative signed | Maze | off | 16 | -2.0 |
| Environment | Reward | Correction | Metric | Mean difference |
|---|---|---|---|---|
| Maze-v1 | dense | off | Success | 13.1 |
| Maze-v1 | sparse | off | Success | -15.6 |
| MazeW-v2 | dense | off | Success | 2.4 |
| MazeW-v2 | sparse | off | Success | -4.4 |
| Fall | dense | off | Return | 344.7 |
| Fall | dense | off | Success | 19.6 |
| Task | HTB correction | Normalized AUC difference | Final-return difference |
|---|---|---|---|
| Push | on | -84.1 | 508.3 |
| Push | off | -82.2 | 75.5 |
| Fall | on | 69.4 | 875.4 |
| Fall | off | 226.6 | 560.4 |
| Environment | Setting | Return | Success (%) |
|---|---|---|---|
| Push | HIRO | -5553.6 | 0.0 |
| Push | HTB, suffix correction | -5045.3 | 14.0 |
| Push | HTB, no correction | -5478.1 | 0.8 |
| Fall | HIRO | -8137.8 | 9.6 |
| Fall | HTB, suffix correction | -7262.4 | 32.8 |
| Fall | HTB, no correction | -7577.4 | 24.4 |
| Task | Reward | Independent | Shared critic | Shared actor/critic |
|---|---|---|---|---|
| Reacher-v0 | dense | |||
| Reacher-v0 | sparse | |||
| Maze-v1 | dense | |||
| Maze-v1 | sparse | |||
| MazeW-v2 | dense | |||
| MazeW-v2 | sparse |
| Task | Reward | Corr. | Mean difference | |
|---|---|---|---|---|
| Reacher-v0 | dense | off | 0.1 | |
| Reacher-v0 | dense | off | -2.5 | |
| Reacher-v0 | dense | off | 2.9 | |
| Reacher-v0 | dense | off | -0.9 | |
| Reacher-v0 | dense | on | 18.5 | |
| Reacher-v0 | dense | on | 34.5 |
| Task | Reward | Corr. | Mean difference | |
|---|---|---|---|---|
| Maze-v1 | dense | off | -63.1 | |
| Maze-v1 | dense | off | 21.3 | |
| Maze-v1 | dense | off | 13.8 | |
| Maze-v1 | dense | off | 8.1 | |
| Maze-v1 | sparse | off | -8.1 | |
| Maze-v1 | sparse | off | -0.6 |
| Task | Reward | Corr. | Mean difference | |
|---|---|---|---|---|
| Fall | dense | off | 112.2 | |
| Fall | dense | off | 174.9 | |
| Fall | dense | off | 276.3 | |
| Fall | dense | off | 421.1 | |
| Fall | dense | on | -345.2 | |
| Fall | dense | on | 47.4 |
| Task | Reward | Corr. | Mean difference | |
|---|---|---|---|---|
| Reacher-v0 | dense | off | 2.0 | |
| Reacher-v0 | dense | off | 0.3 | |
| Reacher-v0 | dense | off | 0.9 | |
| Reacher-v0 | dense | off | 2.1 | |
| Reacher-v0 | dense | on | -5.0 | |
| Reacher-v0 | dense | on | 10.1 |
| Task | Reward | Corr. | Mean difference | |
|---|---|---|---|---|
| Maze-v1 | dense | off | 15.6 | |
| Maze-v1 | dense | off | -8.8 | |
| Maze-v1 | dense | off | 4.4 | |
| Maze-v1 | dense | off | -2.5 | |
| Maze-v1 | sparse | off | 0.0 | |
| Maze-v1 | sparse | off | 5.0 |
| Task | Reward | Corr. | Mean difference | |
|---|---|---|---|---|
| Fall | dense | off | -1226.5 | |
| Fall | dense | off | -1053.1 | |
| Fall | dense | off | 3.5 | |
| Fall | dense | off | -332.5 | |
| Fall | dense | on | 2189.9 | |
| Fall | dense | on | 268.7 |
| Task | Reward | Corr. | Mean difference | |
|---|---|---|---|---|
| Reacher-v0 | dense | off | -68.4 | |
| Reacher-v0 | dense | off | -13.1 | |
| Reacher-v0 | dense | off | -12.1 | |
| Reacher-v0 | dense | off | -4.5 | |
| Reacher-v0 | dense | on | 7.9 | |
| Reacher-v0 | dense | on | -39.6 |
| Task | Reward | Corr. | Mean difference | |
|---|---|---|---|---|
| Maze-v1 | dense | off | -6.3 | |
| Maze-v1 | dense | off | -65.6 | |
| Maze-v1 | dense | off | -42.5 | |
| Maze-v1 | dense | off | -21.9 | |
| Maze-v1 | sparse | off | 0.0 | |
| Maze-v1 | sparse | off | -18.8 |
| Task | Estimator | MAE | Action MAE | Signed error | Regret |
|---|---|---|---|---|---|
| Reacher-v0 dense | Direct-Q | ||||
| Reacher-v0 dense | Shared V-A | ||||
| Reacher-v0 dense | Output+target | ||||
| Reacher-v0 dense | Output only | ||||
| Reacher-v0 dense | Target only | ||||
| Reacher-v0 dense | Signed residual |
| Task | Policy seed | Slot-weighted difference | Deduplicated difference |
|---|---|---|---|
| Reacher-v0 dense | 777 | -3.15 | -3.13 |
| Reacher-v0 dense | 778 | -24.92 | -25.01 |
| Reacher-v0 dense | 779 | -3.08 | -3.00 |
| Reacher-v1 sparse | 777 | -0.77 | -0.77 |
| Reacher-v1 sparse | 778 | -0.03 | -0.03 |
| Reacher-v1 sparse | 779 | -1.11 | -1.12 |
| Selected signed error | MAE | ||||
|---|---|---|---|---|---|
| Candidates | Noise | Signed | Projected | Signed | Projected |
| 2 | 0.0 | ||||
| 2 | 0.3 | ||||
| 2 | 1.0 | ||||
| 4 | 0.0 | ||||
| 4 | 0.3 | ||||