VLMs for Robotics

VLM: Vision-Language Model

Latest papers 392

All topics
CardsList
  1. Auditing Instruction-Trajectory Mismatches in Multimodal Robot Demonstrations

    Aug 8, 2026Simon Holk, Ryosuke Takanami, Tatsuya Matsushima +4Robot Imitation LearningVLMs for Robotics

  2. AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

    Aug 7, 2026Guiyu Zhao, Longteng Guo, Yanghong Mei +7Long-Horizon Robotic ManipulationVision-Language-Action Models

  3. Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation

    Aug 6, 2026He Kong, Zengjue Chen, Qi Wang +6Long-Horizon Robotic ManipulationHierarchical RL

  4. In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

    Aug 6, 2026Jiarui Yang, Wen Huang, Jiale Zhang +2ICL for RoboticsContinual Learning for VLA Models

  5. Hijacking Robots with a Piece of Paper: A Systematic Study of Physical Prompt Injection in VLM-Controlled Robots

    Aug 6, 2026S. M . Bhagya P. Samarakoon, M. A. Viraj J. Muthugala, W. K. R. Sachinthana +1VLM RobustnessAdversarial Attacks on VLMs

  6. Fast and Accurate: An Adaptive VLA Inference Framework through Environment-aware Model Selection

    Aug 6, 2026Yuewei Sun, Lang Qin, Zechuan Tian +11Efficient VLA Model InferenceVLMs for Robotics

  7. Suppression Sticks, Locality Is Fragile: A Closed-Loop Target-and-Control Audit of Task-Vector Negation in VLA Policies

    Aug 5, 2026Shaoguang Wang, Weiyu Guo, Rushi Dai +3Robotic Policy EvaluationTask Arithmetic

  8. Track4Action: Distilling World-Centric 3D Tracker into Vision-Language-Action Policies

    Aug 4, 2026Chenyi Wang, Xinkai Wang, Bokai Lin +4Visuomotor Policy LearningVision-Language-Action Models

  9. From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation

    Aug 4, 2026Xiangyun Huang, Xiangchen Wang, Runfeng Lin +5Vision-Language NavigationVLMs for Robotics

  10. How Should Vision-Language-Action Models Use Proprioceptive State?

    Aug 4, 2026Yiren Zhao, Ziyang Chen, Ziyang Rao +5Robotic ControlVision-Language-Action Models

  11. Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models

    Aug 3, 2026Zhaokai Yin, Zhipeng ZhangVision-Language GroundingVision-Language-Action Models

  12. ReTouch: Empowering Contact-Rich Dexterous Manipulation with Online-Refined Tactile Prediction

    Aug 3, 2026Shiqi Zhang, Xin Zhang, Yedong Shen +9Contact-Rich Robotic ManipulationRobotic Manipulation

  13. Uncovering and Mitigating Positional Blind Spots in Vision-Language-Action Models

    Aug 3, 2026Dongdong An, Pengjie Zhao, Yihao Huang +5Vision-Language-Action ModelsVLMs for Robotics

  14. ORCESTRA: VLM-driven Visual Robot programming in Mixed Reality

    Aug 1, 2026Ivan Snegirev, Elizaveta Semenyakina, Mikhail Konenkov +3Digital TwinsLanguage-Conditioned Robot Control

  15. SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance

    Aug 1, 2026Yufei Zhang, Chenlu Zhan, Donghui Sun +2Vision-Language GroundingVLMs for Robotics

  16. FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling

    Jul 31, 2026Li Lin, Wujun Xu, Weiwei Meng +3Efficient VLA Model InferenceEfficient VLA Models

  17. SAGP: Semantic Affordance-Guided Grasp Planning via Coarse-Zone VLM Reasoning

    Jul 31, 2026Muhayy Ud Din, Irfan HussainRobotic GraspingVLMs for Robotics

  18. D-VLC: Decentralized Vision-Language Collaboration for Heterogeneous Embodied Multi-Robot Systems in Unknown Environments

    Jul 31, 2026Yuan Zhou, Ruitong Lin, Shen Wang +5Multi-Agent LLM SystemsMulti-Robot Systems

  19. TEA-AgriVLN: Traversability Estimation Alarm for Agricultural Vision-and-Language Navigation

    Jul 30, 2026Xiaobei Zhao, Xingqi Lyu, Xin Chen +1Embodied NavigationVision-Language Navigation

  20. RedFlow: Redirect Failure into Action-level Corrections for Flow-matching VLA Policy

    Jul 30, 2026Zhengyang Yan, Junhao Li, Fangqi Zhu +6Robot Policy LearningPolicy Optimization

  21. A Systems Engineering Framework for Vision-Language-Enabled UAV Triage and Disaster Response

    Jul 30, 2026Swapnil Saha, Bhuvan Rajanasiriyur Jagadeesha, Karishma Patnaik +1Aerial RoboticsLanguage Model-Based Control

  22. HumanCLAW: Can Vision-Language Models Act Through a Body?

    Jul 29, 2026Li Siyao, Jiawei Gu, Shuai Liu +15VLM EvaluationEmbodied AI

  23. Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA

    Jul 29, 2026Tianhang Yang, Yanze Zheng, Junjie Wang +3Robot Policy LearningExpert Routing

  24. Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots

    Jul 29, 2026Hung Nguyen, Kim Nhat Minh Nguyen, Van Duc Vu +6Robotic GraspingLanguage-Conditioned Robot Manipulation

  25. A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models

    Jul 28, 2026Haoyu Zhang, Yuwei Wu, Jin Chen +6Robotic ManipulationVision-Language-Action Models

  26. Room-Mediated Co-occurrence for Zero-Shot Object-Centric Semantic Navigation via Frontier Scoring

    Jul 28, 2026Adam Scicluna, Gavin Paul, Alen AlempijevicVLMs for RoboticsObject-Goal Navigation