VLMs for Robotics

VLM: Vision-Language Model

Latest papers 392

All topics
CardsList
  1. Leveraging Semantic Maps for City-Scale Cross-View Localization

    Jul 28, 2026Ethan Fahnestock, Erick Fuentes, Philip R Osteen +1Cross-View Geo-LocalizationMap-Based Localization

  2. FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking

    Jul 27, 2026Hai Jiang, Yixian Zou, Binbin Liang +3Vision-Language-Action ModelsAction Chunking

  3. LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratory

    Jul 26, 2026Haobo Wang, Baoli Sun, Anqi Zou +8Robot Failure DetectionRobotics

  4. VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method

    Jul 23, 2026Jiabin Lou, Haopeng Wang, Yuanshuai Wang +6Embodied NavigationRobot Navigation

  5. Robostral Navigate

    Jul 22, 2026Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra +273Robot Policy LearningRobot Navigation

  6. Emergent Compositional Skills in Mixture-of-Experts VLAs

    Jul 22, 2026Shlok Shah, Rhiaan Jhaveri, Tharun Kumar Tiruppali Kalidoss +3Robot Policy LearningRobot Skill Learning

  7. SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

    Jul 22, 2026Yang Xu, Gurpreet Singh Mukker, Raymond Wang +3Robotic GraspingLanguage-Conditioned Robot Manipulation

  8. ReferTrack: Referring Then Tracking for Embodied Visual Tracking

    Jul 22, 2026Hanjing Ye, Tianle Zeng, Jiazhao Zhang +6Visual Object TrackingVisual Grounding

  9. SOPD-SocialNav: Selective On-Policy Distillation for Vision-Language Social Navigation

    Jul 22, 2026Xinyu Zhang, Zishuo Wang, Ling XiaoEfficient VLM InferenceVLM Distillation

  10. Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents

    Jul 21, 2026Guanxiong Chen, Qianjun Xia, Jiawei Peng +24World Models for RoboticsRobotics Simulation

  11. STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models

    Jul 20, 2026Kasra Torshizi, Anukriti Singh, Sidharth Mathur +3Language-Conditioned Robot ControlVLMs for Robotics

  12. G2-Nav: Grounded and Guarded Vision-Language Costmaps for Robot Social Navigation

    Jul 18, 2026Yuwen Liao, Yihang Lan, Yizhuo Yang +4Robot NavigationSafe Robot Navigation

  13. Token-Wise Latent Streaming from Slow Reasoners to Fast Planners for Dynamic Vision Language Navigation

    Jul 18, 2026Tianshuai Hu, Yangyi Zhong, Zeying Gong +7Vision-Language NavigationSocial Navigation

  14. Autonomous VR-Based Risk Detection for Situational Awareness in Dangerous Settings

    Jul 18, 2026Mohammad Eskandari, Murali Krishna Varma Indukuri, Stephanie M. Lukin +1Human-Robot InteractionVLMs for Robotics

  15. IMBench: A Benchmark for Intuitive Robotic Manipulation

    Jul 17, 2026Anurag Maurya, Sukhvansh Jain, Prajwal Avhad +9Contact-Rich Robotic ManipulationRobotic Manipulation

  16. FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models

    Jul 16, 2026Wei Li, Peijin Jia, Yuan Ma +9Visuomotor Policy LearningVision-Language-Action Models

  17. Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models

    Jul 16, 2026Yufeng Ji, Wenhao Tang, Haoyi Niu +3VLM AdaptationVision-Language-Action Models

  18. SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents

    Jul 16, 2026Huaigang Yang, Ya Li, Min Ren +3Robot SafetyAI Agent Safety Benchmarks

  19. Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation

    Jul 15, 2026Boyu Mi, Mengchen Ma, Yifei Yao +10Mobile ManipulationSim-to-Real Transfer

  20. Hy-Embodied-VLM-1.0: Efficient Physical-World Agents

    Jul 14, 2026Ziyi Wang, Xumin Yu, Yongming Rao +19Efficient VLA ModelsMultimodal Foundation Models

  21. Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies

    Jul 13, 2026Ali Ahmadi, Hamed Rahimi, Adrien Jacquet Cretides +3RL for RoboticsSocial Robot Navigation

  22. On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation

    Jul 11, 2026Finn Ferchau, Daniel Pommer, Cristian AxenieLow-Rank AdaptationVision-Language-Action Models

  23. TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging

    Jul 10, 2026Shengzhuo Yang, Ronghao Yu, Chuanjie Lv +5Robot Motion GenerationRobotic Manipulation

  24. LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action

    Jul 9, 2026Qi Lyu, Baicheng Liu, Xudong Wang +3Latent Dynamics ModelingVision-Language-Action Models

  25. Multi-Agent Robotic Control with Onboard Vision-Language Models

    Jul 8, 2026Kajetan Rachwał, Maciej Majek, Bartłomiej Boczek +6Long-Horizon Robotic ManipulationMulti-Agent Control

  26. NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation

    Jul 7, 2026Ziye Wang, Modi Shi, Chaojun Ni +5Memory-Augmented VLMsLong-Horizon Robotic Manipulation