cs.ROOct 7, 2026

Targeted Modality Dropout for Real-Robot Manipulation Robust to Intermittent Vision Loss

Authors: Genki Shikada, Kazuki Osamura, Masaru Ide, Tetsuya Ogata, Kanata Suzuki

Organizations: Fujitsu Limited, Kanagawa 211-8588, Japan. · Faculty of Science and Engineering, Waseda University, Tokyo 169-8050, Japan. · National Institute of Advanced Industrial Science and Technology, Tokyo 100-8921, Japan.

Abstract

Imitation learning policies that integrate multiple sensory modalities are prone to overreliance on a dominant modality, such as vision, during training, which can disrupt policy execution when that modality is lost at inference time. In this paper, we introduce Targeted Modality Dropout (TMD), in which the dependence on each modality is estimated using attention and the most dominant modality is selectively dropped. This is combined with entropy regularization over the dependence distribution. Through real-robot evaluation using a bimanual manipulator, we show that under vision loss the success rate of the baseline policy drops substantially, whereas TMD sustains task execution. In contrast, a conventional dropout that selects the dropped modality at random, without the entropy regularization, fails on many tasks even without vision loss.

Figures & tables

Explore similar work

CardsList
  1. GuidedAttention: Interpretable and Correctable Visual Attention for OOD-Robust Robot Manipulation via Imitation Learning

    Jul 23, 2026Masaki Murooka, Ryoichi Nakajo, Keisuke Shirai +4Visual AttentionRobot Skill Learning

  2. Sensing Which Modality Matters: Evidence-Gated Regularization for Robust VLA Policies

    Sep 2, 2026Yue Yang, Diego Romeres, Chiori Hori +3Robustness of VLA ModelsMultimodal Sensor Fusion