Tool Use in VLMs

VLM: Vision-Language Model

Momentum

13 papers in the last four weeks, up 160% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 76

All topics
CardsList
  1. Harness Compilation: Which Decisions Should a Small Vision-Language Model Keep?

    Oct 8, 2026Minhao Fan, Yinyi Liu, Jiayu Zhao +3Tool Use in VLMsVision-Language Models

  2. IRSTD-Agent: Agentic Infrared Small Target Detection via Zoom-Guided Interaction Learning

    Oct 4, 2026Jiawen Xi, Yu Zhang, Tianyi Zhao +3Tool Use in VLMsInfrared Small Target Detection

  3. CineMR: Tool-Integrated Vision-Language Reasoning for Quantitative Cardiac MRI Assessment

    Oct 1, 2026Kunyang Li, Hai Nguyen, Joshua Lowe +6Tool Use in VLMsMedical VQA

  4. CoEvoWhen: Policy-Tool Coevolution for Ultra-Long Video Temporal Grounding

    Sep 30, 2026Yiduo Jia, Muzhi Zhu, Jinchuan Shi +4Temporal Video GroundingVideo Understanding

  5. EgoTools: Towards Tool-Centric Reasoning in Real-World Egocentric Videos

    Sep 30, 2026Shulin Tian, Junsu Kim, Shuai Liu +17Tool-Use EvaluationTool Use in VLMs

  6. Agentic Tool-Augmented Reasoning for Explainable Image Forgery Detection

    Sep 30, 2026Zhiya Tan, Jing Huang, Changtao Miao +5Tool Use in VLMsImage Forgery Detection

  7. Visual Parallel Search: Learning to Search High-Resolution Images with Parallel Tile Inspection and Adaptive Zoom

    Sep 29, 2026Xijia Tao, Yihua Teng, Xinyu Fu +5Visual Question AnsweringTool Use in VLMs

  8. WeaveAgent: A Two-Stage Tool-Routing Agent for Ultra-High-Resolution Remote Sensing Imagery

    Sep 25, 2026Zhongyu PangRemote Sensing Image UnderstandingTool Use in VLMs

  9. Reasoning with Image Generation

    Sep 14, 2026Nishad Singhi, Hector Garcia Rodriguez, Aditya Arora +2Tool Use in VLMsVLM Reasoning

  10. Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning

    Sep 7, 2026Vishwas Sathish, Viresh Ranjan, Xinliang Zhu +2Tool Use in VLMsMultimodal QA

  11. Making Every Tool Call Count: Necessary Tool-Evidence Path Rewards for Agentic Vision-Language Models

    Sep 3, 2026Xingming Long, Yu Liu, Zhiwei Yang +7Tool Use in VLMsTool-Using Vision-Language Agents

  12. Learning to Zoom Efficiently with a Contrastive Curriculum

    Sep 2, 2026Falko Helm, Iryna GurevychTool Use in VLMsContrastive RL

  13. Self-Evolving Code-with-Image Reasoning

    Aug 11, 2026Tianze Yang, Liang Wu, Ruitong Sun +6Tool Use in VLMsMultimodal Reasoning

  14. Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning

    Aug 10, 2026Jiahao Shao, Yuanbo Yang, Yiyi Liao +3Tool Use in VLMsEfficient VLM Inference

  15. MemeMind: Reference-Guided Trace Construction for Offline Context Optimization

    Aug 10, 2026Run Yang, Weihang Wang, Boheng Sheng +7Tool Use in VLMs

  16. ToolVision: Learning When and How to Use Visual Tools with Capability-Aligned Supervision

    Aug 9, 2026Delin Mao, Chenghao Sun, Jingwei Song +2Tool Use in VLMsTool-Using Vision-Language Agents

  17. OpenVisTool: An Open Recipe for Synthesizing Instructive Visual Tool-Use Trajectories

    Aug 9, 2026Changhao Xiang, Shilin Zhang, Zheng Ma +8Tool-Use EvaluationTool Use in VLMs

  18. Self-Evolving Neuro-Symbolic Skills for Tool-Augmented Spatial Reasoning

    Aug 8, 2026Shi-Yu Tian, Zhuo-Xia Wang, Xuan-Yi Zhu +6Tool Use in VLMsLLM Agent Skill Learning

  19. The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

    Aug 6, 2026Zhiheng Wang, Bo Peng, Lai Wei +1Tool Use in VLMsVisually Grounded Reasoning

  20. Beacon: Knowing When and How to Perform Agentic Visual Reasoning

    Jul 30, 2026Qixun Wang, Yang Shi, Letian Cheng +11Tool Use in VLMsRL for VLMs

  21. FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Self-Verification

    Jul 30, 2026Haoqing Wang, Xingrun Xing, Ziheng Li +2Tool Use in VLMsVLM Reasoning

  22. SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

    Jul 30, 2026Yang Zhou, Zixuan Huang, Sunzhu Li +10Tool Use in VLMsVisual Spatial Reasoning

  23. Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing

    Jul 28, 2026Fengxiang Wang, Jiangnan Huang, Mingshuo Chen +8Remote Sensing Image UnderstandingRemote Sensing VQA

  24. CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding

    Jul 27, 2026Jinlong Yang, Wenhao Zhang, Kuanwei Lin +1Tool Use in VLMsEfficient VLM Inference

  25. MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning

    Jul 27, 2026Tuan-An To, Yuk-Kwan Wong, Tuan-Anh Vu +2Visual Question AnsweringVideo Understanding

  26. OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

    Jul 21, 2026Yu Chen, Caorui Li, Ziyu Xiong +8Temporal Video GroundingAudio-Visual Understanding

  27. ToolSciVer: Multimodal Scientific Claim Verification with Visual Tool Augmented Reinforcement Learning

    Jul 17, 2026Binglin Zhou, Peng Shi, Ryo Kamoi +2Tool Use in VLMsScientific Claim Verification

  28. IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment

    Jul 14, 2026Jinjian Wu, Jiaqi Tang, Wei Wei +5Tool Use in VLMsVLM Reasoning

  29. TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding

    Jul 13, 2026Thanh-Nhan Vo, Thanh-Khoi Nguyen, Trong-Thuan Nguyen +2Tool Use in VLMsSports Video Analysis

  30. CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

    Jul 6, 2026Hairui Zhu, Yiying Yang, Tengjin Weng +5Tool Use in VLMsText-Guided Image Editing

  31. Incentivizing Vision Language Models to Search for Long Video Question Answering

    Jul 3, 2026Harsh Goel, S P Sharan, Sahil Shah +4Tool Use in VLMsLong-Video QA

  32. TACO: Tool-Augmented Credit Optimization for Agentic Tool Use

    Jun 29, 2026Mingkuan Feng, Jinyang Wu, Hao Gu +5Tool Use in VLMsMultimodal QA

  33. Dynamo: Dynamic Skill-Tool Evolution for Vision-Language Agents

    Jun 29, 2026Yutao Sun, Yanting Miao, Hao-Xuan Ma +8Tool Use in VLMsVLM Adaptation

  34. Confidence-Aware Tool Orchestration for Robust Video Understanding

    Jun 25, 2026Yangfan He, Yujin Choi, Jaehong YoonVLM RobustnessTool Use in VLMs

  35. Tool-IQA: Augmenting Image Quality Assessment with Simple Tools

    Jun 15, 2026Guanyi Qin, Junjie Zhang, Chunming He +4Tool Use in VLMsImage Quality Assessment

  36. SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

    Jun 11, 2026Seokju Cho, Ryo Hachiuma, Abhishek Badki +8Tool Use in VLMs3D Spatial Reasoning

  37. Perceive, Interact, Reason: Building Tool-Augmented Visual Agents for Spatial Reasoning

    Jun 11, 2026Changye Li, Meng Lu, Yi Wu +1Tool Use in VLMsVisual Spatial Reasoning

  38. IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents

    Jun 10, 2026Yifan Yang, Zhen Zhang, Jiayi Tian +2Tool Use in VLMsReinforcement Learning

  39. Beyond APIs: Probing the Limits of MLLMs in Physical Tool Use

    Jun 9, 2026Zhixin Ma, Yutong Zhou, Yongqi Li +2Tool Use in VLMsTool-Use Planning

  40. Thinking Without Images: Internalizing Visual Manipulation with On-Policy Self-Distillation

    Jun 7, 2026Yishuo Cai, Jiahui Liu, Yuanxin Liu +9Tool Use in VLMsEfficient VLM Inference

  41. ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents

    Jun 2, 2026Anjie Liu, Yan Song, Zhixun Chen +3Tool Use in VLMsTool-Augmented Language Model Agents

  42. ToolFG: Towards Well-Grounded Fine-Grained Image Classification

    Jun 1, 2026Yu Xue, Haoxuan Qu, Zhuoling Li +4Tool Use in VLMsMultimodal Large Language Models

  43. VisualLeakBench: Reproducible Action-Boundary Propagation Failures in Vision-Language Agents

    May 29, 2026Youting Wang, Yuan Tang, Yitian Qian +1Data LeakageTool Use in VLMs

  44. AnomalyAgent: Training-Free Agentic Models for Zero-/Few-Shot Anomaly Detection

    May 28, 2026Yi Zhang, Jiawen Zhu, Lele Fu +1Few-Shot Anomaly DetectionTool Use in VLMs

  45. When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?

    May 27, 2026Yuan Tian, Bing Hu, Fang Wu +3VLM RobustnessTool Use in VLMs

  46. VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes

    May 25, 2026Jingru Chen, Yiming Liu, Mingtao Chen +5VLM EvaluationTool Use in VLMs

  47. Diversity Over Frequency: Rethinking Tool Use in Visual Chain-of-Thought Agents

    May 25, 2026Dong-Hee Kim, Reuben Tan, Donghyun KimTool Use in VLMsAgentic Reasoning

  48. ETCHR: Editing To Clarify and Harness Reasoning

    May 22, 2026Beichen Zhang, Yuhong Liu, Jinsong Li +3Tool Use in VLMsMultimodal Reasoning

  49. Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval

    May 22, 2026Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang +1Tool Use in VLMsTemporal IR

  50. ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning

    May 19, 2026Zuhao Yang, Kaichen Zhang, Sudong Wang +7Tool Use in VLMsAgentic RL

  51. Aurora: Unified Video Editing with a Tool-Using Agent

    May 18, 2026Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao +4Tool Use in VLMsVideo Diffusion Models

  52. OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics

    May 16, 2026Jinjie Shen, Zheng Huang, Yuchen Zhang +7Tool Use in VLMsImage Forgery Detection

  53. GeoVista: Visually Grounded Active Perception for Vision-Language Understanding of Ultra-High-Resolution Remote Sensing Images

    May 14, 2026Jiashun Zhu, Ronghao Fu, Jiasen Hu +3Remote Sensing Image UnderstandingRemote Sensing VQA