Tool Use in VLMs

VLM: Vision-Language Model

Momentum

13 papers in the last four weeks, up 160% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 76

All topics
CardsList
  1. MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning

    Jul 27, 2026Tuan-An To, Yuk-Kwan Wong, Tuan-Anh Vu +2Visual Question AnsweringVideo Understanding

  2. OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

    Jul 21, 2026Yu Chen, Caorui Li, Ziyu Xiong +8Temporal Video GroundingAudio-Visual Understanding

  3. ToolSciVer: Multimodal Scientific Claim Verification with Visual Tool Augmented Reinforcement Learning

    Jul 17, 2026Binglin Zhou, Peng Shi, Ryo Kamoi +2Tool Use in VLMsScientific Claim Verification

  4. IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment

    Jul 14, 2026Jinjian Wu, Jiaqi Tang, Wei Wei +5Tool Use in VLMsVLM Reasoning

  5. TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding

    Jul 13, 2026Thanh-Nhan Vo, Thanh-Khoi Nguyen, Trong-Thuan Nguyen +2Tool Use in VLMsSports Video Analysis

  6. CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

    Jul 6, 2026Hairui Zhu, Yiying Yang, Tengjin Weng +5Tool Use in VLMsText-Guided Image Editing

  7. Incentivizing Vision Language Models to Search for Long Video Question Answering

    Jul 3, 2026Harsh Goel, S P Sharan, Sahil Shah +4Tool Use in VLMsLong-Video QA

  8. TACO: Tool-Augmented Credit Optimization for Agentic Tool Use

    Jun 29, 2026Mingkuan Feng, Jinyang Wu, Hao Gu +5Tool Use in VLMsMultimodal QA

  9. Dynamo: Dynamic Skill-Tool Evolution for Vision-Language Agents

    Jun 29, 2026Yutao Sun, Yanting Miao, Hao-Xuan Ma +8Tool Use in VLMsVLM Adaptation

  10. Confidence-Aware Tool Orchestration for Robust Video Understanding

    Jun 25, 2026Yangfan He, Yujin Choi, Jaehong YoonVLM RobustnessTool Use in VLMs

  11. Tool-IQA: Augmenting Image Quality Assessment with Simple Tools

    Jun 15, 2026Guanyi Qin, Junjie Zhang, Chunming He +4Tool Use in VLMsImage Quality Assessment

  12. SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

    Jun 11, 2026Seokju Cho, Ryo Hachiuma, Abhishek Badki +8Tool Use in VLMs3D Spatial Reasoning

  13. Perceive, Interact, Reason: Building Tool-Augmented Visual Agents for Spatial Reasoning

    Jun 11, 2026Changye Li, Meng Lu, Yi Wu +1Tool Use in VLMsVisual Spatial Reasoning

  14. IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents

    Jun 10, 2026Yifan Yang, Zhen Zhang, Jiayi Tian +2Tool Use in VLMsReinforcement Learning

  15. Beyond APIs: Probing the Limits of MLLMs in Physical Tool Use

    Jun 9, 2026Zhixin Ma, Yutong Zhou, Yongqi Li +2Tool Use in VLMsTool-Use Planning

  16. Thinking Without Images: Internalizing Visual Manipulation with On-Policy Self-Distillation

    Jun 7, 2026Yishuo Cai, Jiahui Liu, Yuanxin Liu +9Tool Use in VLMsEfficient VLM Inference

  17. ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents

    Jun 2, 2026Anjie Liu, Yan Song, Zhixun Chen +3Tool Use in VLMsTool-Augmented Language Model Agents

  18. ToolFG: Towards Well-Grounded Fine-Grained Image Classification

    Jun 1, 2026Yu Xue, Haoxuan Qu, Zhuoling Li +4Tool Use in VLMsMultimodal Large Language Models

  19. VisualLeakBench: Reproducible Action-Boundary Propagation Failures in Vision-Language Agents

    May 29, 2026Youting Wang, Yuan Tang, Yitian Qian +1Data LeakageTool Use in VLMs

  20. AnomalyAgent: Training-Free Agentic Models for Zero-/Few-Shot Anomaly Detection

    May 28, 2026Yi Zhang, Jiawen Zhu, Lele Fu +1Few-Shot Anomaly DetectionTool Use in VLMs

  21. When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?

    May 27, 2026Yuan Tian, Bing Hu, Fang Wu +3VLM RobustnessTool Use in VLMs

  22. VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes

    May 25, 2026Jingru Chen, Yiming Liu, Mingtao Chen +5VLM EvaluationTool Use in VLMs

  23. Diversity Over Frequency: Rethinking Tool Use in Visual Chain-of-Thought Agents

    May 25, 2026Dong-Hee Kim, Reuben Tan, Donghyun KimTool Use in VLMsAgentic Reasoning

  24. ETCHR: Editing To Clarify and Harness Reasoning

    May 22, 2026Beichen Zhang, Yuhong Liu, Jinsong Li +3Tool Use in VLMsMultimodal Reasoning

  25. Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval

    May 22, 2026Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang +1Tool Use in VLMsTemporal IR

  26. ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning

    May 19, 2026Zuhao Yang, Kaichen Zhang, Sudong Wang +7Tool Use in VLMsAgentic RL

  27. Aurora: Unified Video Editing with a Tool-Using Agent

    May 18, 2026Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao +4Tool Use in VLMsVideo Diffusion Models

  28. OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics

    May 16, 2026Jinjie Shen, Zheng Huang, Yuchen Zhang +7Tool Use in VLMsImage Forgery Detection

  29. GeoVista: Visually Grounded Active Perception for Vision-Language Understanding of Ultra-High-Resolution Remote Sensing Images

    May 14, 2026Jiashun Zhu, Ronghao Fu, Jiasen Hu +3Remote Sensing Image UnderstandingRemote Sensing VQA