VLMs for Robotics

VLM: Vision-Language Model

Latest papers 392

All topics
CardsList
  1. SWIM: Vision-Language-Grounded Soft Whole-Body Interactive Manipulation

    Sep 15, 2026Tingcong Liu, Aye Phyu Phyu Aung, Junjie Xiong +4Language-Conditioned Robot ManipulationWhole-Body Robotic Manipulation

  2. Bridging Learned Visual Perception and Symbolic Belief-Space Planning

    Sep 15, 2026Guy Azran, Michael Navat, Sarah KerenBelief-Space PlanningSymbolic Planning

  3. GeomVLA: Unifying Scene, Motion, and Action in 3D

    Sep 12, 2026Ziyin Xiong, Nikolaos Gkanatsios, Moritz Reuss +1Robotic Manipulation3D Scene Representation

  4. Modality-Decoupled Federated Learning for Privacy-Preserving Embodied Intelligence in 6G

    Sep 10, 2026Zhuodong Liu, Xiangyu Li, Chunhong Yuan +5Multimodal Federated LearningWireless Communications

  5. Show-Harness: Just a VLM Agent Can Play Robots

    Sep 9, 2026Yanzhe Chen, Zechen Bai, Zhijun Cao +7Cross-Embodiment Robot LearningLanguage-Conditioned Robot Control

  6. HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy

    Sep 9, 2026Zengjue Chen, Peidong Liu, Jiawei Li +1Robot Policy LearningWorld Models

  7. GTA-2: A Multi-VLM Framework for Synthesizing Robot Manipulation Skills via Grounded Task Axes

    Sep 9, 2026M. Yunus Seker, Shobhit Aggarwal, Ruwan Wickramarachchi +2Zero-Shot Robotic ManipulationRobot Skill Learning

  8. Estimating Semantic Ambiguity via Gaussian Context Distributions for VLM-Driven Traversability Analysis

    Sep 8, 2026Ramona Häuselmann, Mario A. V. Saucedo, Christoforos Kanellakis +1Uncertainty Estimation for VLA ModelsEmbodied Navigation

  9. Towards Embodied Air-Ground Cooperative Object Search: Benchmark, Dataset and Agentic Method

    Sep 8, 2026Boao Yu, Zimo Chen, Junreng Rao +4Aerial RoboticsAI Agent Benchmarks

  10. 3DWay: Generalizing Robot Manipulation via 3D Consistent Waypoints

    Sep 8, 2026Ziqin Huang, Yingyue Li, Chenyangguang Zhang +6Generalization in Robotic ManipulationTrajectory Representation Learning

  11. ComVLA: Communication-Aware Split Inference for VLA Models in 6G-Connected Robotics

    Sep 7, 2026Boliang Liu, Wint Yi Poe, Jingyun Di +2Efficient VLA Model InferenceEfficient VLA Models

  12. Social Intuition vs. Machine Reasoning: Anticipating Human-Robot Interaction from multiple modalities

    Sep 7, 2026Raphael Lorenzo-Louis, Bertrand Luvison, Serena IvaldiHuman Behavior PredictionHuman-Robot Interaction

  13. GIFT: Guided Intermediate Feature Training via Action-Oriented Structural Supervision for Robotic Manipulation

    Sep 3, 2026Yupeng Zheng, Xiang Li, Songen Gu +11Visual Representation LearningWorld Models for Robotics

  14. Adaptive Vision-Language Grasping via Composable Foundation Priors and Generalizable Grasp Synthesis

    Sep 3, 2026Sixu Yan, Shikang Wang, Binhua Huang +11Robotic GraspingGeneralization in Robotic Manipulation

  15. Toward Unified Robot Learning: Bridging Representation, Vision-Language-Action, and World Models

    Sep 3, 2026Shaunak A. Mehta, Ananya Hazarika, Haochen Zhang +5World Models for RoboticsVLMs for Robotics

  16. FWBC-VLA: Force-Aware Whole-Body Compensation for Contact-Rich Loco-Manipulation

    Sep 3, 2026Yutian Zhang, Siyuan Ma, Liwen Yang +6Contact-Rich Robotic ManipulationWhole-Body Control

  17. FailBench: How Reliable are VLMs at Judging Robot Task Success?

    Sep 3, 2026Zaruhi Navasardyan, Tatul Danielyan, Hrant DavtyanVLM EvaluationRobot Failure Detection

  18. Scaling Bimanual Household Manipulation from 1,500 hours of Demonstrations to On-Policy Corrections

    Sep 3, 2026Jiafeng Xu, Qi Li, Yan Shen +7Bimanual Robotic ManipulationRobot Imitation Learning

  19. Air-Ground Collaborative Vision-and-Language Navigation via Shared Bird's-Eye Maps

    Sep 3, 2026Shuning Zhang, Liang Li, Yunheng Wang +3Robot NavigationUAV Navigation

  20. Towards Generalizable Visually Grounded Exploration of Household Devices

    Sep 1, 2026Linhao Zheng, Zeming Liu, Wangke Chen +4Visually Grounded ReasoningVLMs for Robotics

  21. TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback

    Aug 26, 2026Jianbo Zhou, Boyuan Zhao, Yuzheng Zhang +9Contact-Rich Robotic ManipulationTactile Sensing for Robotic Manipulation

  22. Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?

    Aug 12, 2026Vladyslava Rudas, Dmytro KuzmenkoVLM EvaluationRobot Safety

  23. HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting

    Aug 12, 2026Xikai Sun, Cangtian Zhou, Kebin Liu +6Data AugmentationVLMs for Robotics

  24. VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction

    Aug 10, 2026Hongjin Ji, Guoyang Xia, Luoyang Sun +2Robot Policy AdaptationVision-Language-Action Models

  25. Skills in Weights, Memory in Code: Hybrid Learning for Memory-Dependent Robot Manipulation

    Aug 10, 2026Yunhao Zhao, Zhenyang Ni, Haoyang Chen +2Long-Horizon Robotic ManipulationRobot Skill Learning

  26. Action- and Language-Conditioned Video Assessment for Embodied Control

    Aug 8, 2026Hwanhee Kim, Jaehyun Jang, Seungmin Cha +3Video-Language Model EvaluationLong-Horizon Agent Evaluation