cs.ROOct 5, 2026

Arm-wise Compositional Generalization in Dual-Arm Vision-Language-Action Models

Authors: Zaibin Zhang, Binghao Ran, Yuhan Wu, Zhongbo Zhang, Yifan Wang, Junwei Jiang, Junlan Xiao, Wangcheng Shi, +5 more

Organizations: Dalian University of Technology · Shanghai Jiao Tong University · The Chinese University of Hong Kong, Shenzhen · University of Oxford

Abstract

Generalization in multi-arm collaboration can be studied as composing familiar atomic skills in new ways across arms. However, existing evaluations offer limited insight into which training and architectural choices support this ability under different coordination requirements. We introduce \textbf{ACG-Bench}, a benchmark for \emph{Arm-wise Compositional Generalization} that provides a common testbed for studying skill recomposition in dual-arm policies. It contains 23 task--condition pairs across 8 task families, with 6 in-domain conditions and 17 unseen compositions covering reordering, synchronization, their combination, and cross-task composition. All methods receive the same per-arm atomic prompts, and success requires achieving the task goal while satisfying physical milestones and specified order or timing constraints. Using π0.5π_{0.5} as a common vision-language-action backbone, we compare representative data-augmentation and architectural strategies with shared source data and a common evaluation protocol. Our architectural study examines arm-token grouping, skill-specific LoRA adapters (SkillLoRA), and arm-wise attention (AWA), highlighting the complementarity of skill-conditioned parameters and attention structure. Combining these choices yields \textbf{AE-VLA}, which achieves 21.53% generalization success in simulation, compared with 2.94% for Single π0.5π_{0.5}, 3.06% for MA-VLA, and 5.53% for two independently controlled π0.5π_{0.5} policies. On physical SO101 robots, AE-VLA reaches 39.00% mean success across five unseen conditions, compared with 10.00% for the strongest baseline. These findings provide empirical guidance for designing dual-arm policies that generalize beyond fixed training routines.

Figures & tables

Appendix figures & tables9 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. Same Scene, Different Task: Skill Alignment for Compositional Generalization in VLAs

    Sep 30, 2026Taegeun Yang, Youngju Na, Yoonki Cho +1Photometric SupervisionCompositional Generalization

  2. AC-VLA: Robust Out-of-Distribution Action Execution via Compositional Learning

    Jul 17, 2026Xiaojiang Peng, Kai Peng, Jie Lu +3Robotic ManipulationSpatial Grounding

  3. Unleashing More Actions via Action Compositional Training for VLA Models

    Jul 1, 2026Kai Peng, Jie Lu, Xiaojiang PengDiffusion-Based Vision-Language-ActionsLarge-Scale Robot Demonstration Datasets