Vision-Language Agents

Latest papers 30

All topics
CardsList
  1. Are Frontier VLM Agents Ready to Be Robot Generalists? An Empirical Study with the Embodied Agent Arena

    Oct 1, 2026Haojian Huang, Pukun Zhao, Zexi Li +7VLM EvaluationVisual Reasoning

  2. Show-Harness: Just a VLM Agent Can Play Robots

    Sep 9, 2026Yanzhe Chen, Zechen Bai, Zhijun Cao +7Cross-Embodiment Robot LearningLanguage-Conditioned Robot Control

  3. Lies We Can See: Joint Verbal and Non-Verbal Deception by VLM Agents in Embodied Social Interactions

    Aug 31, 2026Jaewoo Ahn, Junseo Kim, Hyunseo Kim +4Social Deduction GamesAI Agent Safety Benchmarks

  4. SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation

    Aug 11, 2026Zhou Liu, Ligang Huang, Zeli Su +5GUI AgentsLLM Agent Skill Retrieval

  5. ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning

    Jul 14, 2026Jiahang Wang, Yirong Yang, Yanqing Zhu +4Hierarchical PlanningVision-Language Navigation

  6. Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

    Jul 9, 2026Feng Wang, Canmiao Fu, Zhipeng Huang +3Multimodal MemoryEpisodic Memory

  7. Dynamo: Dynamic Skill-Tool Evolution for Vision-Language Agents

    Jun 29, 2026Yutao Sun, Yanting Miao, Hao-Xuan Ma +8Tool Use in VLMsVLM Adaptation

  8. LandslideAgent with Multimodal LandslideBench: A Domain-Rule-Augmented Agent for Autonomous Landslide Identification and Analysis

    Jun 17, 2026Chengfu Liu, Dongyang Hou, Junwu Xiang +5Semantic SegmentationVision-Language Agents

  9. GUITrans2Act: Understanding User Operational Behaviors from Mobile GUI Interactions with Vision-Language Models

    Jun 11, 2026Yudong Zhang, Lei Hu, Daoyang Liu +4Mobile GUI AutomationVision-Language Agents

  10. Guide Me Out: A Framework to Benchmark VLM Operators Communication in Crisis Scenarios

    Jun 8, 2026Giacomo Gonella, Stefano Menini, Marco GueriniVLM EvaluationDisaster Response

  11. MIRAGE: Mobile Agents with Implicit Reasoning and Generative World Models

    Jun 3, 2026Zhichao Yang, Yuanze Hu, Haojie Hao +7Mobile GUI AutomationLatent Visual Reasoning

  12. Multi-Turn Multi-Agent Dialogue for Collaborative Reconstruction Improves VLM Performance on Spatial Reasoning, But Only Barely

    May 29, 2026Chalamalasetti Kranti, Sherzod Hakimov, David SchlangenVisual Spatial ReasoningMulti-Agent Collaboration

  13. SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes

    May 29, 2026Tianhui Liu, Jie Feng, Zhiheng Zheng +6Spatial Reasoning BenchmarksVisual Spatial Reasoning

  14. DepthAgent: Towards Better Universal Depth Estimation via Sample-wise Expert Selection

    May 22, 2026Jie Zhu, Girish Chandar Ganesan, Xiaoming LiuMetric Depth EstimationMonocular Depth Estimation

  15. GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

    May 18, 2026Xiongbin Wu, Zhihao Luo, Shanzhe Lei +7Reinforcement LearningGroup Relative Policy Optimization

  16. ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models

    May 11, 2026Tingshu Mou, Jiabo He, Renying Wang +5Visual Spatial Reasoning3D Spatial Reasoning

  17. Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?

    May 9, 2026Filippo Ziliotto, Ciro Beneduce, Bruno Lepri +3AI Agent EvaluationVision-Language Grounding

  18. PRISM: Perception Reasoning Interleaved for Sequential Decision Making

    May 6, 2026Mohamed Salim Aissi, Clemence Grislain, Clement Romac +4Active PerceptionVLM Reasoning

  19. What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity

    May 5, 2026Haoxi Li, Qinglin Hou, Jianfei Ma +6Intrinsic MotivationRL Exploration

  20. AI-Gram: When Visual Agents Interact in a Social Network

    Apr 23, 2026Andrew ShinMulti-Agent LLM SystemsMulti-Agent Systems

  21. If you're waiting for a sign... that might not be it! Mitigating Trust Boundary Confusion from Visual Injections on Vision-Language Agentic Systems

    Apr 21, 2026Jiamin Chang, Minhui Xue, Ruoxi Sun +3VLM RobustnessAdversarial Attacks on VLMs

  22. AgentRVOS for MeViS-Text Track of 5th PVUW Challenge: 3rd Method

    Apr 20, 2026Deshui Miao, Chao Yang, Chao Tian +4Image SegmentationVideo Object Segmentation

  23. SlowBA: An efficiency backdoor attack towards VLM-based GUI agents

    Mar 9, 2026Junxian Li, Tu Lan, Haozhen Tan +2Backdoor AttacksGUI Agents

  24. Vision Wormhole: Latent-Space Communication in Heterogeneous Multi-Agent Systems

    Feb 17, 2026Xiaoze Liu, Ruowang Zhang, Weichen Yu +7Multi-Agent SystemsMultimodal Agents

  25. EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents

    Jan 23, 2026Xinze Li, Ziyue Zhu, Siyuan Liu +4Episodic MemoryLong-Horizon Agent Evaluation