cs.ROSep 29, 2026

Disentangling Spurious Correlations in Vision-Language-Action Models via Predicting Domain-Invariant Latent Lookahead

Authors: Junghyun Kim, Ngseo Kim, ChungWoo Lee, Seoyeon Lee, Woo-Jeong Baek, Adam Zhou, Chip Huyen, Jun-Ki Lee, +2 more

Organizations: OpenMind, San Francisco, CA, USA · Seoul National University, Seoul, Korea · Hyundai Motors, Korea · Ajou University, Korea · Tommoro Robotics, Korea

Abstract

Vision-Language-Action (VLA) models remain brittle under visual distribution shifts, often relying on spurious correlations tied to domain-specific factors rather than task-relevant structure. We propose Domain-Invariant Latent Lookahead (DILL), a representation-learning framework that mitigates shortcut learning in VLA policies. Our key idea is to supervise policies with domain-invariant future latents learned from domain-transformed trajectory data. A Task-Domain Encoder is trained with contrastive objectives and Gaussian disentanglement regularization to separate task-relevant structure from domain-specific visual variation. The learned encoder then provides future latents for VLA policy learning through lookahead prediction and domain disentanglement, encouraging the policy to focus on task-relevant structure rather than incidental visual factors. Counterfactual task-view evaluations show that DILL reduces shortcut reliance, while LIBERO-Plus evaluations demonstrate improved visual robustness, with 69.1% average success, 11.4 percentage points above the strongest baseline. Real-world manipulation experiments further support DILL's applicability beyond controlled simulation. Complementary latent-space diagnostics show that these behavioral gains are accompanied by representations that better preserve task-consistent structure while suppressing domain-specific variation. Our project page is available at https://dill-vla.github.io/.

Figures & tables

Appendix figures & tables14 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. Transport Discrepancy as a Reliability Signal for Vision-Language-Action Models

    Dec 1, 2025Wanpeng Zhang, Ye Wang, Hao Luo +6Action ChunksDiscrepancy

  2. Where Predictive Supervision Goes Shapes What VLA Policies Learn

    Sep 29, 2026Hanseul Kim, Jewon Yeom, Youngjoon Jeong +2Generalizable Vision-Language-Action PoliciesAction Prediction

  3. From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model

    May 21, 2026Bing Hu, Zaijing Li, Rui Shao +4Diffusion-Based Vision-Language-ActionsLatent Actions