Tool-Using Vision-Language Agents

Momentum

15 papers in the last four weeks, up 200% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 101

All topics
CardsList
  1. SceneActBench: Can Agents Act on the 3D Scenes They See?

    Jul 24, 2026Yifei Zhao, Xiangxin Zhou, Wenhao Yang +11AI Agent BenchmarksTool-Using Vision-Language Agents

  2. Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA

    Jul 17, 2026Ce Zhang, Ziyang Wang, Yulu Pan +6Temporal Video GroundingTool-Using Vision-Language Agents

  3. AdaTurn: Budget-Aware Test-Time Scaling for Active Visual Perception Agents

    Jul 16, 2026Susan Liang, Chao Huang, Filippos Bellos +3Test-Time ScalingTool-Using Vision-Language Agents

  4. VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning

    Jul 3, 2026Zhenkun Gao, Yicheng Bao, Jinlong Peng +13Multimodal RAGVideo QA

  5. GMO-E2^2DIT: Grounded Multi-Operation Editing for E-Commerce Images

    Jul 1, 2026Zipeng Guo, Xiaoan Liu, Lichen Ma +9Image Editing EvaluationText-Guided Image Editing

  6. PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

    Jun 30, 2026Dengxian Gong, Yuanzheng Wu, Haobo Yuan +11Vision-Language GroundingTool-Using Vision-Language Agents

  7. SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search

    Jun 30, 2026Ming Dai, Zhihong Lu, Jinjie Gu +5Tool-Augmented Language Model AgentsAgentic Search

  8. ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents

    Jun 30, 2026Binjie Zhang, Mike Zheng ShouReinforcement LearningGroup Relative Policy Optimization

  9. TACO: Tool-Augmented Credit Optimization for Agentic Tool Use

    Jun 29, 2026Mingkuan Feng, Jinyang Wu, Hao Gu +5Tool Use in VLMsMultimodal QA

  10. Dynamo: Dynamic Skill-Tool Evolution for Vision-Language Agents

    Jun 29, 2026Yutao Sun, Yanting Miao, Hao-Xuan Ma +8Tool Use in VLMsVLM Adaptation

  11. ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering

    Jun 26, 2026ZhengXian Wu, Hangrui Xu, Kai Shi +8Multimodal RAGMultimodal Search Agents

  12. VideoAgent: All-in-One Framework for Video Understanding and Editing

    Jun 22, 2026Hengji Zhou, Lingxuan Huang, Jian Wang +4Video Editing BenchmarksLLM Agent Orchestration

  13. S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence

    Jun 18, 2026Yalun Dai, Hao Li, Shulin Tian +10Visual Spatial Reasoning3D Spatial Reasoning

  14. CaVe-VLM-CoT: An Interpretable Vision-Language Model Framework

    Jun 16, 2026Sneha Rao, Shaina Raza, Dhanesh RamachandramVLM EvaluationVision-Language Grounding

  15. Guava: Distilling Frontier VLMs into a Compact Agent through a Robotic Manipulation Harness

    Jun 16, 2026Haowen Liu, Xirui Li, Shaoxiong Yao +5Long-Horizon Robotic ManipulationVLM Distillation

  16. GeoDisaster: Benchmarking Orchestrated Agents for Operational Disaster Geo-Intelligence

    Jun 15, 2026Maram Hasan, Aman Verma, Savitra Roy +5Disaster Damage AssessmentRL for Language Model Reasoning

  17. VisualClaw: A Real-Time, Personalized Agent for the Physical World

    Jun 15, 2026Haoqin Tu, Jianwen Chen, Zijun Wang +14Continual Learning for LLM AgentsAI Agent Benchmarks

  18. Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning

    Jun 13, 2026Zhengbo Zhang, Changtao Miao, Jinbo Su +10Multimodal IRMultimodal Grounding

  19. SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

    Jun 11, 2026Seokju Cho, Ryo Hachiuma, Abhishek Badki +8Tool Use in VLMs3D Spatial Reasoning

  20. Perceive, Interact, Reason: Building Tool-Augmented Visual Agents for Spatial Reasoning

    Jun 11, 2026Changye Li, Meng Lu, Yi Wu +1Tool Use in VLMsVisual Spatial Reasoning

  21. AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness

    Jun 9, 2026Yijian Li, Changze Li, Hantian Shi +4Vision-Language NavigationTool-Using Vision-Language Agents

  22. IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment

    Jun 6, 2026Zichen Zhu, Yuheng Sun, Mingxuan Zhu +11Text-Guided Image EditingTool-Using Vision-Language Agents

  23. Skill-3D: Evolving Scene-Aware Skills for Agentic 3D Spatial Reasoning

    Jun 5, 2026Haoyuan Li, Zhengdong Hu, Jun Wang +23D Spatial ReasoningTool-Using Vision-Language Agents

  24. Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators

    Jun 4, 2026Chenming Zhu, Jingli Lin, Yilin Long +4Visual Spatial ReasoningWorld Model Learning

  25. MapAgent: An Industrial-Grade Agentic Framework for City-scale Lane-level Map Generation

    Jun 3, 2026Deguo Xia, Zihan Li, Haochen Zhao +6HD Map ConstructionAutonomous Driving