Efficient VLA Models

VLA: Vision-Language-Action

Latest papers 70

All topics
CardsList
  1. XS-VLA: Teaching Tiny Vision-Language-Action Models with Spatial Supervision and Demonstration Conditioning

    Jul 5, 2026Iok Tong Lei, Ying Jie Yap, Wei Huang +5Robot Policy LearningLanguage-Conditioned Robot Manipulation

  2. Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs

    Jul 2, 2026Junhao Shi, Siyin Wang, Xiaopeng Yu +3Self-Supervised Pre-TrainingEfficient VLA Models

  3. Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?

    Jun 26, 2026Guoheng Sun, Kaixi Feng, Shwai He +8Model CompressionEfficient VLA Models

  4. UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models

    Jun 22, 2026Lin Sun, Zhiwei Guan, Conglin Wang +7Efficient VLM InferenceEfficient VLA Model Inference

  5. PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models

    Jun 21, 2026Xianghui Wang, Feng Chen, Wenbo Zhang +4Efficient VLA ModelsVision-Language-Action Models

  6. UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling

    Jun 19, 2026Tao Xu, Runhao Zhang, Zhijian Huang +7World Models for RoboticsMulti-View Learning

  7. FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation

    Jun 18, 2026Duc Minh Nguyen, Nghiem Tuong Diep, Binh Gia Nguyen +20VLM AdaptationEfficient VLA Models

  8. Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think

    Jun 18, 2026Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha +18Model CompressionEfficient VLA Model Inference

  9. PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space

    Jun 16, 2026Bochen Yang, Lianlei ShanEfficient VLA ModelsLatent Visual Reasoning

  10. vla.cpp: A Unified Inference Runtime for Vision-Language-Action Models

    Jun 6, 2026Khanh D. Nguyen, Hung T. Ho, Chinh T. Nguyen +5AI Accelerator InferenceEfficient VLM Inference

  11. TBD-VLA: Temporal Block Diffusion Vision Language Action Model

    Jun 5, 2026Sung-Wook Lee, Xuhui Kang, Yen-Ling KuoEfficient VLA Model InferenceEfficient VLA Models

  12. VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies

    May 28, 2026Mingjian Gao, Wenqiao Zhang, Yuqian Yuan +9Efficient VLM InferenceEfficient VLA Model Inference

  13. ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models

    May 28, 2026Ye Li, Huanan Liu, Kangye Ji +7Efficient VLM InferenceEfficient VLA Model Inference

  14. Ω-QVLA: Robust Quantization for Vision-Language-Action Models via Composite Rotation and Per-step Scaling

    May 27, 2026Xinyu Wang, Mingze Li, Sicheng Lyu +6VLM QuantizationEfficient VLA Model Inference

  15. DriveMA: Rethinking Language Interfaces in Driving VLAs with One-Step Meta-Actions

    May 20, 2026Weicheng Zheng, Yixin Huang, Qiao Sun +2VLMs for Autonomous DrivingEfficient VLA Models

  16. ActQuant: Sub-4-bit Action-Guided Quantization for Vision-Language-Action Models

    May 19, 2026Arash Akbari, Arman Akbari, Masih Eskandar +11Mixed-Precision QuantizationVLM Quantization

  17. Offline Semantic Guidance for Efficient Vision-Language-Action Policy Distillation

    May 15, 2026Jin Shi, Brady Zhang, Yishun LuVLM DistillationEfficient VLA Model Inference

  18. Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model

    May 14, 2026Tao Lin, Yuxin Du, Jiting Liu +14Language-Conditioned Robot ManipulationEfficient VLA Models

  19. LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models

    May 11, 2026Boyang Shen, Kaixiang Yang, Hao Wang +4Efficient VLM InferenceEfficient VLA Model Inference

  20. One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy

    May 8, 2026Zuojin Tang, Shengchao Yuan, Xiaoxin Bai +4Action-Conditioned World ModelsEfficient VLA Models

  21. ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations

    May 8, 2026Yuhao Zhou, Yunpeng Zhu, Yang Zhou +7Vision-Language ModelsEfficient VLA Models

  22. MolmoAct2: Action Reasoning Models for Real-world Deployment

    May 4, 2026Haoquan Fang, Jiafei Duan, Donovan Clay +26RoboticsEfficient VLA Models

  23. Latent Bridge: Feature Delta Prediction for Efficient Dual-System Vision-Language-Action Model Inference

    May 4, 2026Yudong Liu, Yuan Li, Zijia Tang +12Efficient VLM InferenceEfficient VLA Model Inference

  24. Motubrain: An Advanced World Action Model for Robot Control

    Apr 30, 2026Motubrain Team, Chendong Xiang, Fan Bao +17Robotic ControlWorld Models for Robotics