VLMs for Robotics

VLM: Vision-Language Model

Latest papers 392

All topics
CardsList
  1. Refusals That Bend: Measuring and Predicting Task Malleability in Embodied VLM Planners

    Sep 30, 2026Leo Y. Lin, Mikhail Kuznetsov, Muslum Ozgur Ozmen +1Robot SafetyLLM Safety Evaluation

  2. ProAct-VLM: Pre-Failure Vision-Language Task Replanning with Continuous Perception Feedback

    Sep 29, 2026Ahmed Nader Ahmed, Omar Moured, Mughni Irfan Mohammed Abdul +2Robot Policy AdaptationLong-Horizon Robotic Manipulation

  3. RoboHarn-Evo: Evolving Hierarchical Physical Knowledge for Self-Improving Robotic Manipulation

    Sep 29, 2026Shifeng Bao, Fanding Huang, Yihan Lin +7Long-Horizon Robotic ManipulationContinual Robot Learning

  4. Video2STL: Grounding VLM-Generated Temporal Specifications for Robot Learning

    Sep 29, 2026Merve Atasever, Keyan Azbijari, Cagan Bakirci +6Robot Policy LearningSignal Temporal Logic

  5. Beyond Token Importance: Preserving Spatial Scaffolds for Efficient Vision-Language-Action Inference

    Sep 29, 2026Jiayu Chen, Shuyong Gao, Jingkai Jia +6Efficient VLA Model InferenceVLMs for Robotics

  6. Spotter: Let the Embodied Model Lead, and the VLM Reflect for It

    Sep 29, 2026Long Li, Qichao Zhao, Yue Yang +6Robot Failure RecoveryVision-Language-Action Models

  7. RoboChrono: A Real Robot Benchmark for Streaming Task Understanding

    Sep 29, 2026Yuzhou Wu, Longteng Fan, Zimeng Li +22Next-Action PredictionRobot Manipulation Benchmarks

  8. Cooperative Multi-Agent Vision-Language-Action Models via Reinforced Fine Tuning

    Sep 29, 2026Ruixiao Xu, Wong Lik Hang Kenny, Zhiqian Liu +12Vision-Language-Action ModelsVLMs for Robotics

  9. MM-ABC: Towards Generalist Mobile Manipulation via Seeing, Coordinating and Imagining

    Sep 28, 2026Qiwei Liang, Guangyu Chen, Shaolong Zhu +6Robotic ControlMobile Manipulation

  10. Uni-VLaT: Whole-Body Tactile Adaptation of VLA Policies for Humanoid Loco-Manipulation

    Sep 28, 2026Zihao Wang, Shutong Liu, Siqi Zheng +5Humanoid Loco-ManipulationTactile Sensing

  11. PanoVLN: Towards Effective Panoramic Vision-and-Language Navigation

    Sep 28, 2026Zhen Wang, Changpeng Wang, Zhe Liu +5Vision-Language NavigationVLMs for Robotics

  12. ARS: Agentic Reward System for Robot Learning

    Sep 28, 2026Sheng Hu, Weiyi Lu, Lingbing Zeng +5RL for RoboticsProcess Reward Models

  13. RAVEL: Asynchronous Rolling Inference for Flow-Based Vision-Language-Action Models

    Sep 28, 2026Yuhan Chen, Ke Yu, Pengfei Liu +3Efficient VLA Model InferenceVision-Language-Action Models

  14. Quantile Head for Vision-Language-Action Models

    Sep 28, 2026Xuan Wang, Yinan Wu, Haoran Duan +1Quantile RegressionEfficient VLA Model Inference

  15. CodeActionBench: Evaluating Agentic Code-as-Policy for Embodied Manipulation

    Sep 27, 2026Yiheng Lyu, Xueying Jiang, Wenhao Li +2Robotic Policy EvaluationRobotic Manipulation

  16. Recursive Harness Distillation across Agents for Robot Manipulation

    Sep 27, 2026Seungyeon Kim, Junhoo Lee, Minkyu Kim +2Robotic ManipulationRobot Policy Generalization

  17. DualManip: Agentic Dynamic Manipulation via Dual-Path Semantic Reasoning and Geometric Adaptation

    Sep 25, 2026Chengxi Li, Yan Di, Yingyue Li +3Robotic GraspingLanguage-Conditioned Robot Manipulation

  18. Robo-Harness K1: Harnessing Robot-Use Agents via Perception Augmentation

    Sep 24, 2026Zexi Li, Yehang Zhang, Wenqian Li +12Language-Conditioned Robot ManipulationTool-Using Agents

  19. MemBodied: Recurrent Associative Memory for Vision-Language-Action Models

    Sep 23, 2026Tej Deep Pala, Navonil Majumder, Bryce Goh +4Robotic ManipulationVision-Language-Action Models

  20. VLMs Can Describe, But Not Measure: Object-Centric Scene Understanding for Robotic Manipulation

    Sep 23, 2026Enrico Saccon, Tommaso Faraci, Iñigo De La Ossa Zarzuelo +3Robotic ManipulationVLMs for Robotics

  21. CereVLA: Cerebellum-Inspired Consequence-Aware Residual Governance for Efficient Vision-Language-Action Execution

    Sep 23, 2026Shuai Zeng, Yuxuan Liang, Hangmiao Hu +4Efficient VLA Model InferenceVision-Language-Action Models

  22. Generalizing Manipulation Skills with a Local Coding Agent

    Sep 22, 2026Raman Talwar, Elias Nijs, Andreas Verleysen +1Language Model-Based ControlCoding Agents

  23. Generalists Act, Specialists Intervene: Modular Stage-Selective Reinforcement Learning for Vision-Language-Action Manipulation

    Sep 22, 2026Chongyu Zhu, Hyegang Kim, Jaden Hinds +3RL for RoboticsRobot Policy Learning

  24. RoboTwin-Phys: Do WAMs and VLAs Understand the Physical World?

    Sep 22, 2026Jiaqi Zhang, Feng Ye, Mingjia Yang +6Generalization in Robotic ManipulationRobotic Manipulation

  25. Beyond Reconstruction Error: Analytical and Data-Driven Action Tokenization for Autoregressive Vision-Language-Action Models

    Sep 22, 2026Yuxin Yang, Gaohan He, Changxue Guan +1Vision-Language-Action ModelsVLMs for Robotics

  26. CableVLA: Simulation-Privileged Global-Local Representation Learning for Cable Routing

    Sep 22, 2026Zhifei Teng, Bo Feng, Xiang Zou +4Visuo-Tactile Representation LearningSim-to-Real Transfer