VLMs for Robotics

VLM: Vision-Language Model

Latest papers 392

All topics
CardsList
  1. SpatialHarness: Test-Time Spatial Scaffolding for Fine Robotic Manipulation

    Oct 8, 2026Jiayu Wang, Yue Yu, Bin Zhu +2Robotic ManipulationVLMs for Robotics

  2. Recompose and Refine Latent Reasoning Flows for Vision-Language-Action Models

    Oct 8, 2026Hongyu Shi, Sen Zhao, Zuyu Zhang +5Vision-Language-Action ModelsVLMs for Robotics

  3. Rendering-Free Lookahead for Question-Guided Active Vision

    Oct 8, 2026Koya Sakamoto, Daichi Azuma, Shuhei Kurita +4Vision-Based Robot ControlVLMs for Robotics

  4. OpenViTac: Learning and Benchmarking Visuo-Tactile Policies in a Unified Sim-and-Real Framework

    Oct 7, 2026Yifan Wu, Qin Li, Nan Min +14Robot Manipulation BenchmarksTactile Sensing for Robotic Manipulation

  5. YUBI-STAG: Contact and Semantic-Rich Alignment for VLAs via Automated Video-Language Grounding

    Oct 7, 2026Masatoshi Tateno, Takehiko Ohkawa, Yueh-Hua Wu +4Vision-Language GroundingVLMs for Robotics

  6. StairVLA: Stage-Aware Hierarchical Action Generation for Vision-Language-Action Models

    Oct 6, 2026Shangyuan Yuan, Xinda Qi, Yujiang Pu +2Efficient VLA Model InferenceVision-Language-Action Models

  7. Seeing the Invisible: Physics-Guided Visual Prompting for Temperature- and Radiation-Aware VLA Navigation

    Oct 6, 2026Hojoon Son, Fan ZhangSafe Robot NavigationVision-Language Navigation

  8. When Does Retrieval Help? A Study of In-Context Adaptation in Vision-Language-Action Models

    Oct 4, 2026Zixuan Liu, Joris Köster, Zizhan Zheng +1Vision-Language-Action ModelsRetrieval-Augmented ICL

  9. GeoBridge-VLA: Geometry-Aware Residual Adaptation for Vision-Language-Action Models

    Oct 4, 2026Hyun Song, Kangmin Kim, Loren Jinsoo Um +4Robotic ManipulationVision-Language-Action Models

  10. Imagine the Future, Internalize the Gist: Efficient VLA Reasoning via Internalized Spatiotemporal Imagination

    Oct 2, 2026Shenglan Li, Zhendong Mi, Hengyi Zhu +6VLMs for RoboticsReasoning for VLA Models

  11. DuoMind: Enabling Distributed Multi-Robot Coordination with Semantic Communication

    Oct 1, 2026Hanchu Zhou, Dechen Gao, Hang Wang +5Semantic CommunicationMulti-Robot Coordination

  12. ATI-VLA: Action-Centric Predictive Vision-Language-Action Models via Actionable Alignment Then Adaptive Injection

    Oct 1, 2026Yijie Zhu, Rui Shao, Jie He +8Robotic ManipulationVision-Language-Action Models

  13. UniTrackPLA: Unified Panorama-Language-Action Model for Instruction-Guided Navigation and Dynamic Person Tracking

    Oct 1, 2026Pengfei Qi, Haoran Lin, Sizhuang Chen +7Visual Object TrackingRobot Navigation

  14. Are Frontier VLM Agents Ready to Be Robot Generalists? An Empirical Study with the Embodied Agent Arena

    Oct 1, 2026Haojian Huang, Pukun Zhao, Zexi Li +7VLM EvaluationVisual Reasoning

  15. When Reasoning Helps Action: Monitoring and Steering Chain-of-Thought in Vision-Language-Action Policies

    Sep 30, 2026Sathwik Karnik, Joseph JR. Lee, Aryaman Gupta +1VLMs for Autonomous DrivingVision-Language-Action Models

  16. Token-World: World Modeling in Vision-Language Model Token Space for Robot Manipulation

    Sep 30, 2026Chuyao Fu, Xiaowei Chi, Yuhan Rui +14World ModelsAction-Conditioned World Models

  17. Same Scene, Different Task: Skill Alignment for Compositional Generalization in VLAs

    Sep 30, 2026Taegeun Yang, Youngju Na, Yoonki Cho +1Vision-Language-Action ModelsCounterfactual Data Augmentation

  18. Towards a General Humanoid Loco-Manipulation Model via Egocentric Whole-Body Human Data Pretraining

    Sep 30, 2026Chongyang Xu, Zhao Wu, Jin Chen +9Humanoid Loco-ManipulationCross-Embodiment Robot Learning

  19. ChronoGraph: Functional 4D Scene Graphs with Vision-Language Models for Interaction Understanding and Grounded Planning

    Sep 30, 2026Chenyangguang Zhang, Malgorzata Gwiazda, Guanlong Jiao +5Graph-Based Planning4D Scene Understanding

  20. GroundingPI: A Grounding Foundation Model towards Physical Intelligence with Visual Primitives

    Sep 30, 2026Qize Yu, Lianrui Fan, Boyu Chen +23Vision-Language GroundingVLMs for Robotics

  21. Looking Back to Move Forward: Temporal Verification for Generative Robot Policies

    Sep 30, 2026Haoxuan Wang, Wayne Wu, Yan Yan +1Robot Policy LearningRobotic Policy Evaluation