VLMs for Robotics

VLM: Vision-Language Model

Latest papers 392

All topics
CardsList
  1. SPAN-Nav: Generalized Spatial Awareness for Versatile Embodied Navigation

    Mar 10, 2026Jiahang Liu, Tianyu Xu, Jiawei Chen +9Embodied NavigationVision-Language Navigation

  2. APPLV: Adaptive Planner Parameter Learning from Vision-Language-Action Model

    Mar 9, 2026Yuanjie Lu, Beichen Wang, Zhengqi Wu +4Robot NavigationRobot Policy Generalization

  3. Multimodal Behavior Tree Generation: A Small Vision-Language Model for Robot Task Planning

    Mar 6, 2026Riccardo Andrea Izzo, Cristiano Battistini, Gianluca Bardaro +1Large Language Model-Based Robot PlanningSynthetic Data Generation for Robotics

  4. Observing and Controlling Features in Vision-Language-Action Models

    Mar 5, 2026Hugo Buurmeijer, Carmen Amo Alonso, Aiden Swann +1VLM InterpretabilityVision-Language-Action Models

  5. OpenFrontier: General Navigation with Visual-Language Grounded Frontiers

    Mar 5, 2026Esteban Padilla-Cerdio, Boyang Sun, Marc Pollefeys +1Robot NavigationVision-Language Navigation

  6. I-Perceive: A Foundation Model for Vision-Language Active Perception

    Feb 28, 2026Yongxi Huang, Zhuohang Wang, Wenjing Tang +3Active PerceptionRobot Foundation Models

  7. NovaPlan: Zero-Shot Long-Horizon Manipulation via Closed-Loop Video Language Planning

    Feb 23, 2026Jiahui Fu, Junyu Nan, Lingfeng Sun +7Long-Horizon Robotic ManipulationZero-Shot Robotic Manipulation

  8. VLANeXt: Recipes for Building Strong VLA Models

    Feb 20, 2026Xiao-Ming Wu, Bin Fan, Kang Liao +6Robotic ManipulationVision-Language-Action Models

  9. Replanning Human-Robot Collaborative Tasks with Vision-Language Models via Semantic and Physical Dual-Correction

    Feb 16, 2026Taichi Kato, Takuya Kiyokawa, Namiko Saito +1Language-Conditioned Robot ManipulationLarge Language Model-Based Robot Planning

  10. Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies

    Feb 6, 2026Fangyuan Wang, Peng Zhou, Jiaming Qi +4Efficient VLM InferenceVisuomotor Policy Learning

  11. TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control

    Jan 21, 2026Yuteng Sun, Haoran Wang, Ruofei Bai +4Robotic ControlDiffusion Policy

  12. Visual-Language-Guided Task Planning for Horticultural Robots

    Jan 17, 2026Jose Cuaran, Kendall Koe, Aditya Potnis +2Large Language Model-Based Robot PlanningVision-Language Grounding

  13. Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation

    Dec 29, 2025Guo Ye, Zexi Zhang, Xu Zhao +4Contact-Rich Robotic ManipulationWorld Models

  14. StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision

    Dec 26, 2025Shengliang Deng, Mi Yan, Yixin Zheng +7Visual Spatial ReasoningRobotic Manipulation

  15. Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics

    Dec 15, 2025Enshen Zhou, Yibo Li, Jingkun An +123D Spatial ReasoningVLMs for Robotics

  16. IndustryNav: Exploring Spatial Reasoning of Embodied Agents in Dynamic Industrial Navigation

    Nov 21, 2025Yifan Li, Lichi Li, Anh Dao +15Visual Spatial ReasoningEmbodied Navigation

  17. SlotVLA: Towards Modeling of Object-Relation Representations in Robotic Manipulation

    Nov 10, 2025Taisei Hanyu, Nhat Chung, Huy Le +10Representation LearningObject-Centric Representation Learning

  18. AERMANI-VLM: Structured Prompting and Reasoning for Aerial Manipulation with Vision Language Models

    Nov 3, 2025Sarthak Mishra, Rishabh Dev Yadav, Avirup Das +3Aerial RoboticsStructured Prompting

  19. UrbanVLA: A Vision-Language-Action Model for Urban Micromobility

    Oct 27, 2025Anqi Li, Zhiyong Wang, Jiazhao Zhang +5Robot NavigationSafe Robot Navigation

  20. VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models

    Oct 15, 2025Dominick Reilly, Manish Kumar Govind, Le Xue +1Domain AdaptationVLM Adaptation

  21. Verifier-free Test-Time Sampling for Vision-Language-Action Models

    Oct 7, 2025Suhyeok Jang, Dongyoung Kim, Changyeon Kim +2Test-Time ScalingVision-Language-Action Models

  22. ZeST: an VLM-based Zero-Shot Traversability Navigation for Unknown Environments

    Aug 26, 2025Shreya Gummadi, Mateus V. Gasparino, Gianluca Capezzuto +2Robot NavigationSafe Robot Navigation

  23. VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting

    Jul 7, 2025Juyi Lin, Amir Taherin, Arash Akbari +11Robotic ControlEfficient VLA Model Inference

  24. AntiGrounding: Executable Robot Trajectories as Visual Prompts for VLM-Guided Manipulation

    Jun 14, 2025Wenbo Li, Yiteng Chen, Wenhao Li +1Trajectory GenerationLanguage-Conditioned Robot Manipulation

  25. Gondola: Grounded Vision Language Planning for Robotic Manipulation

    Jun 12, 2025Shizhe Chen, Ricardo Garcia, Paul Pacaud +1Long-Horizon Robotic ManipulationRobot Task Planning

  26. Image-based Geo-localization for Robotics: Are Black-box Vision-Language Models there yet?

    Jan 28, 2025Sania Waheed, Bruno Ferrarini, Michael Milford +2VLM RobustnessCross-View Geo-Localization

  27. Open-Vocabulary Object-Goal Navigation by Generalizing Semantic Mapping with Dense CLIP

    Jul 12, 2024Meng Wei, Chenyang Wan, Tai Wang +6Embodied NavigationVision-Language Navigation

  28. Bridging Language and Action: A Survey of Language-Conditioned Robot Manipulation

    Dec 17, 2023Xiangtong Yao, Hongkuan Zhou, Oier Mees +12Language-Conditioned Robot ManipulationVLMs for Robotics