cs.ROSep 30, 2026

From Local Whole-Body VLA Behaviors to Scene-Scale Aerial Manipulation

Authors: Weixiang Guo, Rui Jin, Haotian Jin, Xinhang Xu, Ruiyang Liu, Haoran Zhao, Yi Wang, Weiqi Gai, +2 more

Organizations: School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore 639798 · College of Electronics and Information Engineering, Shanghai Institute of Intelligent Science and Technology, Tongji University, Shanghai 201804, China · School of Aeronautic Science and Engineering, Beihang University, Beijing 100191, China · NTU–VinUni Joint Research Laboratory for Embodied AI and Robotics, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore 639798, and VinUniversity, Hanoi, Vietnam

Abstract

Vision-language-action (VLA) models enable task-conditioned interaction, but extending them to scene-scale aerial manipulation remains challenging due to costly whole-body demonstrations, latency-induced action-state misalignment, and cross-site behavior composition. We present a unified framework for synthetic policy training and scene-scale execution on articulated uncrewed aerial manipulators (UAMs). A scene-reconfigurable pipeline synthesizes task-conditioned, kinodynamically feasible trajectories and synchronized multiview observations for VLA training without physical-platform demonstrations. Measured-progress-aligned realization (MPAR) aligns asynchronously returned action chunks with measured execution progress and realizes them as continuous, dynamically feasible trajectories. A relational Scene Graph grounds language goals to object instances and feasible interaction regions, while topology-guided transfer connects local behaviors across sites. Local VLA skills achieve 39/60 successes (65.0%) in simulation under oracle target and feasible-handoff conditions. Under 500-ms added latency, with and without a transient command-update stall, MPAR reduces median takeover phase error by 0.212 s over nominal-time alignment. The complete system completes 21/50 simulated multi-site missions (42.0%) and is further validated on a physical articulated UAM.

Figures & tables

Explore similar work

CardsList
  1. AeroManip-VLA: Scalable Vision-Language-Action Learning for Aerial Manipulation with RL-Generated Demonstrations

    Sep 29, 2026Rui Huang, Yanlin Mu, Lidong Li +3Aerial ManipulationDiffusion-Based Vision-Language-Actions

  2. Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review

    Jul 7, 2026Inkyu Sa, Chanoh Park, Hea-Min Lee +2Bimanual ManipulationGripper

  3. VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training

    Jun 3, 2026Siyuan Yang, Linzheng Guo, Ouyang Lu +10Vision-Language-Action FrameworkRobotic Data Acquisition