Generalist Vision--Language--Action

Latest papers 17

All topics
CardsList
  1. RouteRLT: Learning When and Which RL Specialist Should Control a Vision-Language-Action Policy

    Sep 22, 2026Chongyu Zhu, Jaden Hinds, Hyegang Kim +3Generalist Vision--Language--ActionIcr-Rl

  2. TaskAnchor: Grounding Task State in Reactive VLAs for Long-Horizon Manipulation

    Sep 20, 2026Hengyan Liu, Wenlve Zhou, Bo Yue +7Generalist Vision--Language--ActionLong-Horizon Manipulation

  3. HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface

    Sep 17, 2026Zimu Han, Yiming Zeng, Jiyao Zhang +9Generalist Vision--Language--ActionHuman-In-The-Loop

  4. M2Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models

    Sep 16, 2026Chunpu Xu, Zhixuan Liang, Yuhao Zhang +6Discrete Action TokenizersDiffusion-Based Vision-Language-Actions

  5. DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting

    Aug 30, 2026Yuxuan Gao, Shiqi Zhang, Yedong Shen +6Generalist Vision--Language--ActionAction Generation

  6. Fast and Accurate: An Adaptive VLA Inference Framework through Environment-aware Model Selection

    Aug 6, 2026Yuewei Sun, Lang Qin, Zechuan Tian +11Generalist Vision--Language--ActionReactive

  7. Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation

    Jul 8, 2026Hongyu Qu, Jianzhe Gao, Xiaobin Hu +6Generalist Vision--Language--ActionVision-Language-Action Framework

  8. Initiation Safety: A Missing Dimension in Generalist-Robot Safety

    Jul 8, 2026Zhijin Meng, Francisco CruzSafety ClaimsAuthorization

  9. Reflective VLA: In-Context Action Consequences Make VLAs Generalize

    Jun 23, 2026Qing Lian, Kent Yu, Lei ZhangGeneralist Vision--Language--ActionRdf

  10. OpenHLM: An Empirical Recipe for Whole-Body Humanoid Loco-Manipulation

    Jun 20, 2026Yingdong Hu, Haodong Zhu, Boyuan Zheng +6Humanoid Loco-ManipulationGeneralist Vision--Language--Action

  11. Overcoming Dynamics-Blindness: Training-Free Pace-and-Path Correction for VLA Models

    May 12, 2026Yanyan Zhang, Chaoda Song, Vikash Singh +6Generalist Vision--Language--ActionPhotometric Supervision

  12. ECHO: Continuous Hierarchical Memory for Vision-Language-Action Models

    May 9, 2026Yanbin Hu, Jin Cui, Jiayi Lu +6Generalist Vision--Language--ActionLong-Horizon Manipulation

  13. E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes

    Apr 6, 2026Jiajun Zhai, Hao Shi, Shangwei Guo +2Diffusion-Based Vision-Language-ActionsGeneralist Vision--Language--Action

  14. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies

    Dec 5, 2025Zhiying Du, Bei Liu, Yaobo Liang +7Generalist Vision--Language--ActionIterative Co-Training