VLMs for Robotics

VLM: Vision-Language Model

Latest papers 392

All topics
CardsList
  1. Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration

    May 29, 2026Jun Wang, Xiaohao Xu, Xiaonan HuangRoboticsRobot Safety

  2. Primitive Subspaces Mediate Few-Shot Transfer in VLAs

    May 29, 2026Anya Singh, Cabrel Happi, Jai Relan +2Robot Skill LearningFew-Shot Learning

  3. RoboWits: Unexpected Challenges for Robotic Creative Problem Solving

    May 28, 2026Chunru Lin, Hongxin Zhang, Fenghao Yu +5Bimanual Robotic ManipulationRobotics

  4. VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies

    May 28, 2026Mingjian Gao, Wenqiao Zhang, Yuqian Yuan +9Efficient VLM InferenceEfficient VLA Model Inference

  5. SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation

    May 28, 2026Shilin Ma, Chubin Zhang, Changyuan Wang +6Efficient VLM InferenceRobotic Manipulation

  6. ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models

    May 28, 2026Ye Li, Huanan Liu, Kangye Ji +7Efficient VLM InferenceEfficient VLA Model Inference

  7. GEM: Generative Supervision Helps Embodied Intelligence

    May 27, 2026Ruowen Zhao, Bangguo Li, Zuyan Liu +9Vision-Language-Action ModelsEmbodied AI

  8. Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation

    May 25, 2026Kailing Li, Tianwen Qian, Lijin Yang +43D Spatial ReasoningVision-Language Navigation

  9. Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models

    May 23, 2026Yurou Yang, Muyuan Lin, Roberto Martin-Martin +43D ReconstructionGeometric Representation Learning

  10. IntentionNav: A Benchmark for Intent-Driven Object Navigation from Implicit Human Instruction

    May 22, 2026Lin Qian, Shijie Li, Sihao Lin +4Visual NavigationVLMs for Robotics

  11. Autonomous Frontier-Based Exploration with VLM Guidance

    May 22, 2026Aarush Aitha, Avideh ZakhorMobile RoboticsFrontier-Based Exploration

  12. Pre-VLA: Preemptive Runtime Verification for Reliable Vision-Language-Action and World-Model Rollouts

    May 21, 2026Zhen Sun, Yongjian Guo, Haoran Sun +6Vision-Language-Action ModelsVLMs for Robotics

  13. Machine Intelligence that Understands Visual and Linguistic Information and Interacts with Humans and Environments

    May 20, 2026Van Quang NguyenImage CaptioningEfficient ViTs

  14. The Yes-Man Syndrome: Benchmarking Abstention in Embodied Robotic Agents

    May 19, 2026Doguhan Yeke, Elif Su Temirel, Ananth Shreekumar +3VLM RobustnessLarge Language Model-Based Robot Planning

  15. DEFLECT: Temporal Counterfactual Preference Learning for Delay-Robust Asynchronous VLAs

    May 19, 2026Yixiang Zhu, Yonghao Chen, Zijie Yang +2Robotic ControlVisuomotor Policy Learning

  16. ManiSoft: Towards Vision-Language Manipulation for Soft Continuum Robotics

    May 18, 2026Ziyu Wei, Luting Wang, Chen Gao +2Language-Conditioned Robot ManipulationRobotic RL

  17. TaskGround: Structured Executable Task Inference for Full-Scene Household Reasoning

    May 18, 2026ZhiYuan Feng, Yu Deng, Ruichuan An +11VLMs for Robotics

  18. AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents

    May 18, 2026Pan Wang, Yihao Hu, Xiujin Liu +3Memory-Augmented VLMsReward Shaping

  19. CosFly-Track: A Large-Scale Multi-Modal Dataset for UAV Visual Tracking via Multi-Constraint Trajectory Optimization

    May 18, 2026Xiangyue Wang, Hanxuan Chen, Songsheng Cheng +7Aerial RoboticsTrajectory Optimization

  20. EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models

    May 16, 2026Haozhe Shan, Xiancong Ren, Han Dong +9VLM EvaluationVision-Language Grounding

  21. "I'm Not Mad, Just Focused'': Understanding Human Emotions in Human-Robot Collaboration

    May 16, 2026Seung Chan Hong, Dana Kulić, Leimin TianHuman-Robot CollaborationHuman-Robot Interaction

  22. UAM: A Dual-Stream Perspective on Forgetting in VLA Training

    May 15, 2026Jianke Zhang, Yuanfei Luo, Yucheng Hu +6Robotic ManipulationVision-Language-Action Models

  23. When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution

    May 14, 2026Zilin Zhu, Longteng Guo, Yanghong Mei +5Long-Horizon PlanningLong-Horizon Agent Evaluation

  24. Realtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAs

    May 13, 2026Jiahui Niu, Kefan Gu, Yucheng Zhao +5Efficient VLA Model InferenceSpeculative Decoding