cs.ROOct 7, 2026

TMT: Runtime Backdoor Detection for Vision-Language-Action Policies on Unseen Tasks

Authors: Zirun Zhou, Jingfeng Zhang, HaoChuan Xu, Xizhe Zhang, Elliott Wen, Jing Sun, Hong Jia

Organizations: The University of Auckland · Fudan University · Institute of Science Tokyo

Abstract

Backdoored vision-language-action (VLA) policies can preserve benign task performance while producing malicious actions when a trigger appears. Detecting such activation is difficult because malicious behavior can comprise individually plausible actions, while unfamiliar tasks introduce legitimate changes in observations and behavior. We introduce TMT, a runtime backdoor detector based on Token Manifold and latent Transition modeling. Trained on benign rollouts, its two branches assess input-token structure and prediction errors in adjacent-layer latent dynamics. A suspicious rollout identified by the token manifold branch, once confirmed through latent deviations, guides transition selection for subsequent monitoring. We further explore policy purification through self-distillation: a frozen copy of the backdoored policy provides benign-input actions to supervise a student on paired benign and triggered observations, without requiring a separate clean reference policy. For evaluation, we adapt traditional backdoor detectors and repurpose anomaly and failure detection methods as VLA backdoor detectors. In a post-hoc comparison with ten baselines, TMT achieves state-of-the-art backdoor detection performance on unseen tasks across three VLA backdoor attacks. Our project page is available at https://zzr42.github.io/tmt/.

Figures & tables

Explore similar work

CardsList
  1. TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors

    Jul 14, 2026Pinhan Fu, Xianda Guo, Xuetao Li +5Inference-Time Defense

  2. DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models

    Date pendingZonghuan Xu, Jiayu Li, Yunhan Zhao +3Black-Box Adversarial AttacksAttack-Success Rate

  3. ATAAT: Adaptive Threat-Aware Adversarial Tuning Framework against Backdoor Attacks on Vision-Language-Action Models

    May 9, 2026Kewei Chen, Yayu Long, Shuai Li +1Diffusion-Based Vision-Language-ActionsVision-Language Model Adaptation