Higher-Order Action Supervision Makes A Strong Policy Class
Organizations: Institute for AI Industry Research (AIR), Tsinghua University · Zenfex AI Lab · University of Electronic Science and Technology of China · Horizon Robotics
Abstract
Modern data-driven decision-making methods, such as imitation learning (IL) and reinforcement learning (RL), have achieved great success in solving many complex tasks. However, these methods often suffer from serious control instability and robustness issues when applied in real-world applications such as robotics and autonomous driving, posing notable challenges for their practical deployment. We argue that this instability issue stems largely from their limitations in solely supervising and optimizing zeroth-order actions (i.e., the action labels), failing to account for higher-order action dynamics and temporal consistency. In this paper, we show that simultaneously supervising both zeroth- and first-order actions can dramatically enhance policies' performance and control robustness. To achieve this, we introduce a novel and elegant loss scheme supported by formal theoretical guarantees that can equip any off-the-shelf policy model (e.g., deterministic, stochastic, or flow policies) with the capability for higher-order action supervision, without requiring any structural modifications. Moreover, our proposed method can serve as a lightweight plug-and-play module that seamlessly integrates with a broad spectrum of existing offline RL frameworks. Extensive evaluations on OGBench and D4RL demonstrate that our approach yields substantial performance and robustness improvements across a wide range of continuous control environments. Notably, our method can also enhance policies' out-of-distribution (OOD) generalization capability in the challenging low-data regime, making it an ideal tool in tackling many real-world control problems.
Figures & tables
| Det. Policy | Sto. Policy (mean sup.) | Sto. Policy (standard) | Flow Policy | |||||
|---|---|---|---|---|---|---|---|---|
| Task Category (Avg. of 5 tasks) | TD3+BC | TD3+BC+ours | ReBRAC | ReBRAC+ours | IQL | IQL+ours | IFQL | IFQL+ours |
| antmaze-large-navigate | 98{\scriptstyle\pm 3}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!15}) | 98{\scriptstyle\pm 2}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!17}) | 68{\scriptstyle\pm 5}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!15}) | 36{\scriptstyle\pm 14}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!8}) | ||||
| antmaze-giant-navigate | 65{\scriptstyle\pm 10}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!23}) | 61{\scriptstyle\pm 12}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!35}) | 9{\scriptstyle\pm 1}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!5}) | 4{\scriptstyle\pm 3}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!1}) | ||||
| humanoidmaze-medium-navigate | 42{\scriptstyle\pm 5}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!8}) | 55{\scriptstyle\pm 10}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!33}) | 36{\scriptstyle\pm 3}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!3}) | 64{\scriptstyle\pm 13}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!4}) | ||||
| humanoidmaze-large-navigate | 4{\scriptstyle\pm 1}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!2}) | 4{\scriptstyle\pm 2}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!2}) | 3{\scriptstyle\pm 1}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!1}) | 12{\scriptstyle\pm 3}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!1}) | ||||
| antsoccer-arena-navigate | 16{\scriptstyle\pm 3}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!3}) | 16{\scriptstyle\pm 4}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!16}) | 23{\scriptstyle\pm 3}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!15}) | 40{\scriptstyle\pm 13}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!7}) | ||||
| Task | TD3+BC | +CAPS | +L2C2 | +LipsNet | +Extra head | TD3+BC+Ours |
|---|---|---|---|---|---|---|
| Hopper-m | 42.6{\scriptstyle\pm 5.1}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!2.5}) | 42.7{\scriptstyle\pm 7.5}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!2.6}) | 43.2{\scriptstyle\pm 3.6}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!3.1}) | 41.5{\scriptstyle\pm 7.8}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!1.4}) | 44.1{\scriptstyle\pm 12.7}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!\textbf{4.0}}) | |
| Hopper-me | 39.6{\scriptstyle\pm 8.2}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!21.8}) | 39.8{\scriptstyle\pm 8.3}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!22.0}) | 32.8{\scriptstyle\pm 18.5}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!15.0}) | 26.6{\scriptstyle\pm 8.6}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!8.8}) | 42.3{\scriptstyle\pm 10.8}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!\textbf{24.5}}) | |
| Hopper-e | 57.1{\scriptstyle\pm 29.7}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!33.9}) | 55.2{\scriptstyle\pm 34.5}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!32.0}) | 16.9{\scriptstyle\pm 2.8}({\color[rgb]{1,0,0}\downarrow\!6.3}) | 30.6{\scriptstyle\pm 15.1}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!7.4}) | 93.5{\scriptstyle\pm 13.6}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!\textbf{70.3}}) | |
| HalfCheetah-m | 29.6{\scriptstyle\pm 5.6}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!13.2}) | 30.3{\scriptstyle\pm 7.1}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!13.9}) | 6.6{\scriptstyle\pm 3.0}({\color[rgb]{1,0,0}\downarrow\!9.8}) | 28.1{\scriptstyle\pm 4.5}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!11.7}) | 31.5{\scriptstyle\pm 2.4}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!\textbf{15.1}}) | |
| HalfCheetah-me | 19.8{\scriptstyle\pm 3.4}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!4.4}) | 28.6{\scriptstyle\pm 3.8}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!13.2}) | 3.3{\scriptstyle\pm 2.2}({\color[rgb]{1,0,0}\downarrow\!12.1}) | 20.6{\scriptstyle\pm 3.5}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!5.2}) | 35.6{\scriptstyle\pm 2.4}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!\textbf{20.2}}) | |
| HalfCheetah-e | 2.4{\scriptstyle\pm 1.9}({\color[rgb]{0.5,0.5,0.5}\uparrow\!0.7}) | 0.8{\scriptstyle\pm 0.6}({\color[rgb]{1,0,0}\downarrow\!0.9}) | 0.2{\scriptstyle\pm 1.8}({\color[rgb]{1,0,0}\downarrow\!1.5}) | 3.9{\scriptstyle\pm 2.1}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!\textbf{2.2}}) |
Appendix figures & tables11 assets
Supplementary material from the paper’s appendix.
Appendix
| Det. Policy | Sto. Policy (mean sup.) | Sto. Policy (standard) | Flow Policy | |||||
|---|---|---|---|---|---|---|---|---|
| Task Category | TD3+BC | TD3+BC+ours | ReBRAC | ReBRAC+ours | IQL | IQL+ours | IFQL | IFQL+ours |
| antmaze-large-navigate-singletask-task1-v0 ( ) | 99{\scriptstyle\pm 2}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!7}) | 100{\scriptstyle\pm 1}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!9}) | 80{\scriptstyle\pm 10}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!32}) | 56{\scriptstyle\pm 14}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!32}) | ||||
| antmaze-large-navigate-singletask-task2-v0 | 91{\scriptstyle\pm 4}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!6}) | 92{\scriptstyle\pm 4}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!4}) | 16{\scriptstyle\pm 11}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!8}) | |||||
| antmaze-large-navigate-singletask-task3-v0 | 100{\scriptstyle\pm 0}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!28}) | 100{\scriptstyle\pm 1}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!49}) | 90{\scriptstyle\pm 6}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!18}) | 72{\scriptstyle\pm 10}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!20}) | ||||
| antmaze-large-navigate-singletask-task4-v0 | 99{\scriptstyle\pm 1}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!14}) | 100{\scriptstyle\pm 1}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!16}) | 52{\scriptstyle\pm 22}\,({\color[rgb]{0.5,0.5,0.5}\uparrow\!1}) | 40{\scriptstyle\pm 17}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!22}) | ||||
| antmaze-large-navigate-singletask-task5-v0 | 99{\scriptstyle\pm 0}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!17}) | 99{\scriptstyle\pm 1}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!9}) | 78{\scriptstyle\pm 9}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!24}) | 48{\scriptstyle\pm 19}\,({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!10}) | ||||
| Det. Policy | Sto. Policy (mean sup.) | Sto. Policy (standard) | Flow Policy | |||||
|---|---|---|---|---|---|---|---|---|
| Task Category | TD3+BC | TD3+BC+ours | ReBRAC | ReBRAC+ours | IQL | IQL+ours | IFQL | IFQL+ours |
| Hopper-m | 58.9{\scriptstyle\pm 7.4}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!3.4}) | 85.7{\scriptstyle\pm 1.3}({\color[rgb]{0.5,0.5,0.5}\uparrow\!0.8}) | 68.8{\scriptstyle\pm 5.5}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!1.5}) | 94.2{\scriptstyle\pm 7.2}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!4.7}) | ||||
| Hopper-mr | 58.4{\scriptstyle\pm 9.2}({\color[rgb]{0.5,0.5,0.5}\uparrow\!0.5}) | 94.3{\scriptstyle\pm 10.1}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!13.1}) | 94.2{\scriptstyle\pm 5.5}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!2.5}) | 96.3{\scriptstyle\pm 2.3}({\color[rgb]{0.5,0.5,0.5}\uparrow\!0.1}) | ||||
| Hopper-me | 89.9{\scriptstyle\pm 8.4}({\color[rgb]{0.5,0.5,0.5}\uparrow\!0.1}) | 106.6{\scriptstyle\pm 5.4}({\color[rgb]{0.5,0.5,0.5}\uparrow\!0.2}) | 109.2{\scriptstyle\pm 9.8}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!17.7}) | 89.8{\scriptstyle\pm 8.7}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!12.7}) | ||||
| Hopper-e | 110.5{\scriptstyle\pm 0.2}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!2.2}) | 108.6{\scriptstyle\pm 3.8}({\color[rgb]{0.5,0.5,0.5}\uparrow\!0.1}) | 106.5{\scriptstyle\pm 5.1}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!7.2}) | 106.2{\scriptstyle\pm 8.6}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!9.4}) | ||||
| Halfcheetah-m | 47.9{\scriptstyle\pm 0.4}({\color[rgb]{0.5,0.5,0.5}\uparrow\!0.1}) | 56.9{\scriptstyle\pm 1.1}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!1.5}) | 48.6{\scriptstyle\pm 0.2}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!1.2}) | 52.8{\scriptstyle\pm 0.3}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!1.7}) | ||||
| Det. Policy | Sto. Policy (standard) | Flow Policy | ||||
|---|---|---|---|---|---|---|
| Task Category | base | base + | base | base + | base | base + |
| Hopper-e | 67.3{\scriptstyle\pm 14.3}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!45.8}) | 93.1{\scriptstyle\pm 10.7}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!35.6}) | 97.2{\scriptstyle\pm 12.3}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!25.0}) | |||
| Halfcheetah-e | 5.7{\scriptstyle\pm 1.5}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!3.3}) | 16.2{\scriptstyle\pm 10.1}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!13.4}) | 17.9{\scriptstyle\pm 6.9}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!6.5}) | |||
| Walker2d-e | 91.1{\scriptstyle\pm 14.7}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!64.4}) | 91.6{\scriptstyle\pm 9.5}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!45.2}) | 91.5{\scriptstyle\pm 6.3}({\color[rgb]{0.0195,0.6523,0.082}\uparrow\!1.7}) | |||
| Det. Policy | Sto. Policy (mean sup.) | Sto. Policy (standard) | Flow Policy | |||||
|---|---|---|---|---|---|---|---|---|
| Task Category | TD3+BC | TD3+BC+ours | ReBRAC | ReBRAC+ours | IQL | IQL+ours | IFQL | IFQL+ours |
| Training time (D4RL) | 28 min 30 s | 33 min 6 s | 25 min 8 s | 30 min 34 s | 34 min 44 s | 39 min 56 s | 30 min 49 s | 35 min 52 s |
| Training time (OGBench) | 28 min 23 s | 38 min 56 s | 25 min 11 s | 31 min 54 s | 35 min 7 s | 42 min 5 s | 32 min 0 s | 36 min 51 s |
| Environment | Method | 100k | 300k | 500k | 700k | 1M |
|---|---|---|---|---|---|---|
| Hopper-v2 | SAC | |||||
| SAC + Ours | ||||||
| HalfCheetah-v2 | SAC | |||||
| SAC + Ours | ||||||
| Walker2d-v2 | SAC | |||||
| SAC + Ours |
| Environment (OGBENCH) | IFQL | +Ours | +AK ( ) | +AK ( ) | +AK ( ) |
|---|---|---|---|---|---|
| humanoidmaze-medium-navigate-singletask-task1-v0 | |||||
| humanoidmaze-medium-navigate-singletask-task4-v0 | |||||
| antsoccer-arena-navigate-singletask-task2-v0 | |||||
| antsoccer-arena-navigate-singletask-task4-v0 | |||||
| cube-single-play-singletask-task2-v0 | |||||
| cube-single-play-singletask-task4-v0 |
| Metric | Ours | AK | Additional overhead |
|---|---|---|---|
| Computational cost (per update) | 2.498 GFLOPs | 4.978 GFLOPs | +2.480 GFLOPs (+99.3%) |
| GPU memory | 1.141 GiB | 1.266 GiB | +0.125 GiB (+11.0%) |
| Hyperparameter | Value |
|---|---|
| Learning rate | |
| Optimizer | Adam [ 24 ] |
| Gradient steps | |
| Minibatch size | |
| MLP dimensions | (default); (IQL) |
| Nonlinearity | GELU [ 18 ] |