cs.CVSep 24, 2026

Direction-Scale Decomposition in Action Representation: Rethinking What to Tokenize for Vision-Language-Action Models

Authors: Yufei Duan, Hang Yin, Alberta Longhini, Chao Tang, Danica Kragic

Organizations: Department of Robotics, Perception and Learning, KTH Royal Institude of Technology, Stockholm, Sweden

Abstract

Action representation plays a central role in discrete-token vision-language-action (VLA) learning but remains underexamined. Under conventional pose-increment representations, action tokens are sensitive to execution speed and dataset-specific normalization, potentially obscuring geometric structure shared across demonstrations and datasets. We introduce Direction-Scale Decomposition (DSD), an action representation that decomposes translation and rotation increments into direction and scale components before tokenization. DSD isolates motion direction while retaining magnitudes in separate scale channels. We evaluate DSD with uniform binning (BIN) and BEAST, a B-spline-based tokenizer, in simulation and real-world manipulation under both single-dataset and mixed-dataset training. On LIBERO, DSD improves average success rates with both tokenizers. On SimplerEnv, DSD-BIN outperforms BIN by 10.3 percentage points in overall success rate under mixed-dataset training. Real-robot experiments further show gains both with and without robotics pretraining. These results support DSD as an effective action representation for discrete-token VLA models and suggest its potential to mitigate performance degradation when training on large and diverse dataset mixtures. Our project page with additional resources is available at https://vla-dsd.github.io/

Figures & tables

Explore similar work

CardsList
  1. ActionPiece: Rethinking Action Tokenization for Autoregressive Vision-Language-Action Models

    Sep 16, 2026Shijie Lian, Bin Yu, Zhaolong Shen +5Discrete Action TokenizersDiffusion-Based Vision-Language-Actions

  2. SA-VLA: State-aware tokenizer for improving Vision-Language-Action Models' performance

    Jun 29, 2026Tengyue Jiang, Chunpu Xu, Jiayue Kang +1Discrete Action TokenizersGeneralizable Vision-Language-Action Policies

  3. M2Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models

    Sep 16, 2026Chunpu Xu, Zhixuan Liang, Yuhao Zhang +6Discrete Action TokenizersDiffusion-Based Vision-Language-Actions