VLMs for Robotics

VLM: Vision-Language Model

Latest papers 392

All topics
CardsList
  1. DAM-VLA: Decoupled Asynchronous Multimodal Vision Language Action model

    Jun 10, 2026Pankhuri Vanjani, Zhuoyue Li, Jakub Suliga +4AI ControlRobotic Manipulation

  2. μμVLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models

    Jun 10, 2026Egor Cherepanov, Nikita Kachaev, Daniil Zelezetsky +6Memory-Augmented VLMsRecurrent Transformers

  3. Task Robustness via Re-Labelling Vision-Action Robot Data

    Jun 9, 2026Artur Kuramshin, Özgür Aslan, Cyrus Neary +1Language-Conditioned Robot ManipulationSynthetic Data Generation for Robotics

  4. SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation

    Jun 9, 2026Qianzhong Chen, Hau Zheng, Justin Yu +8RL for RoboticsReward Modeling

  5. Flow Control: Steering Vision-Language-Action Models with Simple Real-Time Inputs

    Jun 8, 2026Jonathan C. Kao, Jason Chan, Andy WangRobotic ControlVision-Language-Action Models

  6. TORL-VLA: Tactile Guided Online Reinforcement Learning for Contact-Rich Manipulation

    Jun 8, 2026Huaihang Zheng, Yi Yang, Kai Ma +8RL for RoboticsLong-Horizon Robotic Manipulation

  7. EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories

    Jun 6, 2026Hassan Jaber, Refinath S N, Luca Cagliero +2Scene Graph GenerationVisual Spatial Reasoning

  8. Ego-Pi: VLA Fine-Tuning for Ego-Centric Human and Robot Data

    Jun 6, 2026Ji Woong Kim, Ke Wang, Zipeng Fu +4Robot Skill LearningRobot Foundation Models

  9. vla.cpp: A Unified Inference Runtime for Vision-Language-Action Models

    Jun 6, 2026Khanh D. Nguyen, Hung T. Ho, Chinh T. Nguyen +5AI Accelerator InferenceEfficient VLM Inference

  10. IntentNav: Learning Spatial-Visual Object Navigation from Human Demonstrations

    Jun 6, 2026Yuxin Cai, Zongtai Li, Maonan Wang +9Robot Imitation LearningFrontier-Based Exploration

  11. VOLT: Vision and Language Trajectory Segmentation for Faster-than-Demonstration Policies

    Jun 4, 2026Robert Ramirez Sanchez, Daniel J. Evans, Dylan P. Losey +1Temporal Action SegmentationImitation Learning

  12. MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action

    Jun 4, 2026Boyang Zhang, Lianlei ShanVisuomotor Policy LearningRobotic Manipulation

  13. A Conversational Framework for Human-Robot Collaborative Manipulation with Distributed Generative AI models

    Jun 4, 2026Arash Ghasemzadeh Kakroudi, Roel PietersLanguage-Conditioned Robot ManipulationLarge Language Model-Based Robot Planning

  14. DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models

    Jun 4, 2026Zhuoming Liu, Jinhong Lin, Kwan Man Cheng +3Vision-Language ModelsVLM Adaptation

  15. FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization

    Jun 3, 2026Yihao Wu, He Zhang, Junbo Tan +2Offline RLVision-Language-Action Models

  16. Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching

    Jun 2, 2026Hao Zhong, Muzhi Zhu, Shenyan Zeng +8VLM EvaluationSpatial Reasoning Benchmarks

  17. EvoMemNav: Efficient Self-Evolving Fine-Grained Memory for Zero-Shot Embodied Navigation

    Jun 2, 2026Zuhao Ge, Xiaosong Jia, Chao Wu +3Embodied NavigationGraph-Based Agent Memory

  18. RobotValues: Evaluating Household Robots When Human Values Conflict

    Jun 2, 2026Jongwook Han, Hyeongjin Kim, Yohan JoAI Agent EvaluationVLMs for Robotics

  19. Dive into the Scene: Breaking the Perceptual Bottleneck in Vision-Language Decision Making via Focus Plan Generation

    Jun 2, 2026Boyuan Xiao, Bohong Chen, Yumeng Li +3Vision-Language-Action ModelsVLMs for Robotics

  20. TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models

    Jun 2, 2026Wenbo Zhang, Jianxiong Li, Shuai Yang +4Test-Time AdaptationTest-Time Adaptation of VLMs

  21. Intercepting the Future: Latent-Space Predictive World Model for Dynamic VLA Manipulation

    Jun 1, 2026Shahram Najam Syed, Arthur Jakobsson, Haoran Hao +1World Models for RoboticsRobotic Manipulation

  22. Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning

    Jun 1, 2026Huayi Zhou, Wei Gao, Dekun Lu +12Generalization in Robotic ManipulationCross-Embodiment Robot Learning

  23. WALL-WM: Carving World Action Modeling at the Event Joints

    Jun 1, 2026Shalfun Li, Victor Yao, Charles Yang +28World Model LearningVision-Language-Action Models

  24. Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation

    Jun 1, 2026Xiang Fang, Wanlong Fang, Changshuo WangRobot NavigationRobotic RL