VLMs for Robotics

VLM: Vision-Language Model

Latest papers 392

All topics
CardsList
  1. Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment

    Apr 27, 2026Kaijun Zhou, Qiwei Chen, Da Peng +3AI Accelerator InferenceEdge Inference

  2. AsyncShield: A Plug-and-Play Edge Adapter for Asynchronous Cloud-based VLA Navigation

    Apr 27, 2026Kai Yang, Zedong Chu, Yingnan Guo +6Robot NavigationVLMs for Robotics

  3. A Deployable Embodied Vision-Language Navigation System with Hierarchical Cognition and Context-Aware Exploration

    Apr 23, 2026Kuan Xu, Ruimeng Liu, Yizhuo Yang +5Robot NavigationVision-Language Navigation

  4. CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors

    Apr 23, 2026Dachong Li, ZhuangZhuang Chen, Jin Zhang +1Vision-Language-Action ModelsVLMs for Robotics

  5. ReCAPA: Hierarchical Predictive Correction to Mitigate Cascading Failures

    Apr 23, 2026Xiyin Zeng, Yuyu Sun, Haoyang Li +2Vision-Language-Action ModelsVision-Language Alignment

  6. Temporal Difference Calibration in Sequential Tasks: Application to Vision-Language-Action Models

    Apr 22, 2026Shelly Francis-Meretzki, Mirco Mutti, Yaniv Romano +1Uncertainty Estimation for VLA ModelsVision-Language-Action Models

  7. A Vision-Language-Action Model for Adaptive Ultrasound-Guided Needle Insertion and Needle Tracking

    Apr 22, 2026Yuelin Zhang, Qingpeng Ding, Longxiang Tang +2Robotic InsertionRobotic Ultrasound

  8. EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

    Apr 21, 2026Yiyang Du, Zhanqiu Guo, Xin Ye +2VLM AdaptationVision-Language-Action Models

  9. LiveVLN: Breaking the Stop-and-Go Loop in Vision-Language Navigation

    Apr 21, 2026Xiangchen Wang, Weiye Zhu, Teng Wang +5Vision-Language NavigationAction Chunking

  10. GenerativeMPC: VLM-RAG-guided Whole-Body MPC with Virtual Impedance for Bimanual Mobile Manipulation

    Apr 21, 2026Marcelino Julio Fernando, Miguel Altamirano Cabrera, Jeffrin Sam +3Mobile ManipulationBimanual Robotic Manipulation

  11. Assessing VLM-Driven Semantic-Affordance Inference for Non-Humanoid Robot Morphologies

    Apr 21, 2026Jess Jones, Raul Santos-Rodriguez, Sabine HauertVLM EvaluationCross-Embodiment Robot Learning

  12. SYMBOLIZER: Symbolic Model-free Task Planning with VLMs

    Apr 20, 2026Sami Azirar, Zlatan Ajanovic, Hermann BlumSymbolic PlanningRobot Task Planning

  13. GaLa: Hypergraph-Guided Visual Language Models for Procedural Planning

    Apr 19, 2026Kun Wang, Yiming Li, Mingcheng Qu +3Visual Spatial ReasoningRobot Task Planning

  14. Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification

    Apr 18, 2026Jiawen Wen, Penglei Sun, Wenjie Zhang +4Safe Robot NavigationVision-Language Navigation

  15. Chain Of Interaction Benchmark (COIN): When Reasoning meets Embodied Interaction

    Apr 18, 2026Xianhao Wang, Xiaojian Ma, Haozhe Hu +7Long-Horizon Robotic ManipulationRobotics

  16. Long-Term Memory for VLA-based Agents in Open-World Task Execution

    Apr 17, 2026Xu Huang, Weixin Mao, Yinhao Li +2Agent MemoryLong-Horizon Robotic Manipulation

  17. ADAPT: Benchmarking Commonsense Planning under Unspecified Affordance Constraints

    Apr 16, 2026Pei-An Chen, Yong-Ching Liang, Jia-Fong Yeh +4Robot Task PlanningRobot Manipulation Benchmarks

  18. Foundation Models in Robotics: A Comprehensive Review of Methods, Models, Datasets, Challenges and Future Research Directions

    Apr 16, 2026Aggelos Psiris, Vasileios Argyriou, Evangelos K. Markakis +4Large Language Model-Based Robot PlanningRobot Foundation Models

  19. World-Value-Action Model: Implicit Planning for Vision-Language-Action Systems

    Apr 16, 2026Runze Li, Hongyin Zhang, Junxi Jin +5Vision-Language-Action ModelsModel-Based Planning

  20. Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents

    Apr 10, 2026Sangwon Baik, Gunhee Kim, Mingi Choi +1Language-Conditioned Robot ManipulationObject Pose Estimation

  21. DRIVE-Nav: Directional Reasoning, Inspection, and Verification for Efficient Open-Vocabulary Navigation

    Mar 30, 2026Maoguo Gao, Zejun Zhu, Zhiming Sun +6Embodied NavigationVLMs for Robotics

  22. Grounding Sim-to-Real Generalization in Robotic Manipulation: An Empirical Study with Vision-Language-Action Models

    Mar 24, 2026Ruixing Jin, Zicheng Zhu, Ruixiang Ouyang +4Domain RandomizationRobotics Simulation