cs.ROOct 6, 2026

ViDAL: A Visual Dynamics-Grounded Action Latent Space for Vision-Language-Action Models

Authors: Yuan Xu, Yixiang Chen, Qisen Ma, Jiabing Yang, Peiyan Li, Kai Wang, Jianhua Yang, Jianlou Si, +5 more

Organizations: CASIA · UCAS · Alibaba Group · FiveAges

Abstract

Vision-Language-Action (VLA) models have become a central paradigm for robot policy learning, which predict actions in three forms: raw action chunks, discrete action tokens, or continuous action latents. However, existing action representations primarily model action trajectories, with limited consideration of the visual dynamics induced by these actions. We introduce ViDAL, a Visual Dynamics-grounded Action Latent Space that anchors continuous action latents in the future visual dynamics of the scene. Specifically, ViDAL learns action latent space by training an Action Variational Autoencoder (Action VAE) to reconstruct action chunks while aligning its latent with future scene dynamics. When integrated into downstream robot policies, the proposed Action VAE serves as a plug-in action interface compatible with multiple VLA architectures and enables optional future-video prediction as an additional capability. Empirically, ViDAL outperforms competitive baselines on LIBERO with 98.1% average success, improves a multi-task π0.5π_{0.5} policy on RoboTwin 2.0 from 54.3% to 65.5% (Clean) and from 33.2% to 43.1% (Random) success rates over 50 dual-arm tasks, and yields 20.0% and 23.4% absolute success-rate gains on real-world single-arm Franka and dual-arm ARX robot platforms.

Figures & tables

Appendix figures & tables4 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. LARA: Latent Action Representation Alignment for Vision-Language-Action Models

    Jun 5, 2026Mengya Liu, Baoxiong Jia, Jiangyong Huang +2Latent Action ModelsLarge-Scale Robot Demonstration Datasets

  2. RotVLA: Rotational Latent Action for Vision-Language-Action Model

    May 13, 2026Qiwei Li, Xicheng Gong, Xinghang Li +5Latent ActionsLatent Action Models

  3. LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies

    Jun 14, 2026Jialei Chen, Kai Wang, Kang Chen +9Latent World ModelsAction Prediction