Tool-Using Vision-Language Agents

Momentum

15 papers in the last four weeks, up 200% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 101

All topics
CardsList
  1. VistaHop: Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch

    Jun 2, 2026Hang He, Chuhuai Yue, Chengqi Dong +6VLM EvaluationVisual Question Answering

  2. ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents

    Jun 2, 2026Anjie Liu, Yan Song, Zhixun Chen +3Tool Use in VLMsTool-Augmented Language Model Agents

  3. SCOPE: Real-Time Natural Language Camera Agent at the Edge

    Jun 1, 2026Nikolaj Hindsbo, Sina Ehsani, Pragyana MishraEfficient VLM InferenceAI Control

  4. VESTA: Visual Exploration with Statistical Tool Agents

    May 29, 2026William Rudman, Abhishek Divekar, Kanishk Jain +6Tool-Using Vision-Language AgentsAutomated Machine Learning

  5. VisualLeakBench: Reproducible Action-Boundary Propagation Failures in Vision-Language Agents

    May 29, 2026Youting Wang, Yuan Tang, Yitian Qian +1Data LeakageTool Use in VLMs

  6. GenClaw: Code-Driven Agentic Image Generation

    May 28, 2026Junyan Ye, Jun He, Zilong Huang +4Image GenerationAgentic Image Generation

  7. Train the Agent, Not the Expert: Learning to Harness Heterogeneous Experts for Multi-Turn Visual Reasoning

    May 28, 2026Yaowu Fan, Tao Han, Dazhao Du +2Tool-Using Vision-Language AgentsVLM Reasoning

  8. Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning

    May 27, 2026Xuanzhao Dong, Wenhui Zhu, Peijie Qiu +11Visual Question AnsweringTool-Using Vision-Language Agents

  9. ForestHG-Trace: Traceable Long-Horizon Ecological Reasoning over Large-Scale Forest Scenes

    May 26, 2026Zihang Cheng, Duanchu Wang, Cheng Li +3Remote Sensing VQATool-Using Vision-Language Agents

  10. PhotoFlow: Agentic 3D Virtual Photography Missions

    May 22, 2026Jiarui Guo, Haojia Wei, Yiming Zhang +5Tool-Using Vision-Language Agents3D Scene Understanding

  11. PathNavigate: A Training-Free Pathology Agent with Surprise-Guided Scan and Shared Slide Memory for Whole-Slide Image VQA

    May 22, 2026Chunze Yang, Qidong Liu, Wenjie Zhao +10HealthcareMedical VQA

  12. AgroTools: A Benchmark for Tool-Augmented Multimodal Agents in Agriculture

    May 21, 2026Zi Ye, Yibin Wen, Xiaoya Fan +10AI Agent BenchmarksTool-Using Vision-Language Agents

  13. TO-Agents: A Multi-Agent AI Pipeline for Preference-Guided Topology Optimization

    May 20, 2026Isabella A. Stewart, Hongrui Chen, Faez AhmedTopology OptimizationMulti-Agent System Optimization

  14. IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools

    May 20, 2026Rongbin Tan, Fangfang Lin, Zhenlong Yuan +10Industrial Anomaly DetectionTool-Using Vision-Language Agents

  15. SimGym: A Framework for A/B Test Simulation in E-Commerce with Traffic-Grounded VLM Agents

    May 19, 2026Han Li, Vibhor Malik, Zahra Zanjani Foumani +17Tool-Using Vision-Language AgentsA/b Testing

  16. OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics

    May 16, 2026Jinjie Shen, Zheng Huang, Yuchen Zhang +7Tool Use in VLMsImage Forgery Detection

  17. VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation

    May 15, 2026Yiming Zhao, Yu Zeng, Wenxuan Huang +11Temporal Video GroundingTool-Using Vision-Language Agents

  18. From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing

    May 14, 2026Anirudh Sundara Rajan, Krishna Kumar Singh, Yong Jae LeeText-Guided Image EditingTool-Using Vision-Language Agents

  19. DermAgent: A Self-Reflective Agentic System for Dermatological Image Analysis with Multi-Tool Reasoning and Traceable Decision-Making

    May 14, 2026Yize Liu, Siyuan Yan, Ming Hu +5Medical Image AnalysisLLM Agent Orchestration

  20. ReTool-Video: Recursive Tool-Using Video Agents with Meta-Augmented Tool Grounding

    May 13, 2026Xiao Liu, Nayu Liu, Junnan Zhu +6Video QATool-Using Vision-Language Agents

  21. Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models

    May 13, 2026Zixing Lei, Changxing Liu, Yichen Xiong +5Long-Horizon Robotic ManipulationTool-Using Vision-Language Agents

  22. From Web to Pixels: Bringing Agentic Search into Visual Perception

    May 12, 2026Bokang Yang, Xinyi Sun, Kaituo Feng +3Visual Question AnsweringVision-Language Grounding

  23. VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority

    May 12, 2026Chenhao Qiu, Yechao Zhang, Xin Luo +2Large Vision-Language ModelsVideo QA

  24. Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents

    May 11, 2026Shijue Huang, Hangyu Guo, Guanting Dong +8Multimodal IRTool-Using Vision-Language Agents

  25. AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation

    May 11, 2026Xi Jiang, Yinjie Zhao, Zesheng Yang +1Tool-Using Vision-Language AgentsVLM Reasoning

  26. InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

    May 8, 2026Bohan Hou, Jiuning Gu, Jiayan Guo +5Multimodal IRMultimodal Search Agents

  27. Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning

    May 5, 2026Qihua Dong, Ruozhen He, Junwen Chen +4Data VisualizationChart QA

  28. GAZE: Grounded Agentic Zero-shot Evaluation with Viewer-Level Tools and Literature Retrieval on Rare Brain MRI

    Apr 25, 2026Duaa Alim, Mogtaba Alim, Liam ChalcroftVLM EvaluationRare Disease Diagnosis