Tool Use in VLMs

VLM: Vision-Language Model

Momentum

13 papers in the last four weeks, up 160% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 76

All topics
CardsList
  1. Harness Compilation: Which Decisions Should a Small Vision-Language Model Keep?

    Oct 8, 2026Minhao Fan, Yinyi Liu, Jiayu Zhao +3Tool Use in VLMsVision-Language Models

  2. IRSTD-Agent: Agentic Infrared Small Target Detection via Zoom-Guided Interaction Learning

    Oct 4, 2026Jiawen Xi, Yu Zhang, Tianyi Zhao +3Tool Use in VLMsInfrared Small Target Detection

  3. CineMR: Tool-Integrated Vision-Language Reasoning for Quantitative Cardiac MRI Assessment

    Oct 1, 2026Kunyang Li, Hai Nguyen, Joshua Lowe +6Tool Use in VLMsMedical VQA

  4. CoEvoWhen: Policy-Tool Coevolution for Ultra-Long Video Temporal Grounding

    Sep 30, 2026Yiduo Jia, Muzhi Zhu, Jinchuan Shi +4Temporal Video GroundingVideo Understanding

  5. EgoTools: Towards Tool-Centric Reasoning in Real-World Egocentric Videos

    Sep 30, 2026Shulin Tian, Junsu Kim, Shuai Liu +17Tool-Use EvaluationTool Use in VLMs

  6. Agentic Tool-Augmented Reasoning for Explainable Image Forgery Detection

    Sep 30, 2026Zhiya Tan, Jing Huang, Changtao Miao +5Tool Use in VLMsImage Forgery Detection

  7. Visual Parallel Search: Learning to Search High-Resolution Images with Parallel Tile Inspection and Adaptive Zoom

    Sep 29, 2026Xijia Tao, Yihua Teng, Xinyu Fu +5Visual Question AnsweringTool Use in VLMs

  8. WeaveAgent: A Two-Stage Tool-Routing Agent for Ultra-High-Resolution Remote Sensing Imagery

    Sep 25, 2026Zhongyu PangRemote Sensing Image UnderstandingTool Use in VLMs

  9. Reasoning with Image Generation

    Sep 14, 2026Nishad Singhi, Hector Garcia Rodriguez, Aditya Arora +2Tool Use in VLMsVLM Reasoning

  10. Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning

    Sep 7, 2026Vishwas Sathish, Viresh Ranjan, Xinliang Zhu +2Tool Use in VLMsMultimodal QA

  11. Making Every Tool Call Count: Necessary Tool-Evidence Path Rewards for Agentic Vision-Language Models

    Sep 3, 2026Xingming Long, Yu Liu, Zhiwei Yang +7Tool Use in VLMsTool-Using Vision-Language Agents

  12. Learning to Zoom Efficiently with a Contrastive Curriculum

    Sep 2, 2026Falko Helm, Iryna GurevychTool Use in VLMsContrastive RL

  13. Self-Evolving Code-with-Image Reasoning

    Aug 11, 2026Tianze Yang, Liang Wu, Ruitong Sun +6Tool Use in VLMsMultimodal Reasoning

  14. Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning

    Aug 10, 2026Jiahao Shao, Yuanbo Yang, Yiyi Liao +3Tool Use in VLMsEfficient VLM Inference

  15. MemeMind: Reference-Guided Trace Construction for Offline Context Optimization

    Aug 10, 2026Run Yang, Weihang Wang, Boheng Sheng +7Tool Use in VLMs

  16. ToolVision: Learning When and How to Use Visual Tools with Capability-Aligned Supervision

    Aug 9, 2026Delin Mao, Chenghao Sun, Jingwei Song +2Tool Use in VLMsTool-Using Vision-Language Agents

  17. OpenVisTool: An Open Recipe for Synthesizing Instructive Visual Tool-Use Trajectories

    Aug 9, 2026Changhao Xiang, Shilin Zhang, Zheng Ma +8Tool-Use EvaluationTool Use in VLMs

  18. Self-Evolving Neuro-Symbolic Skills for Tool-Augmented Spatial Reasoning

    Aug 8, 2026Shi-Yu Tian, Zhuo-Xia Wang, Xuan-Yi Zhu +6Tool Use in VLMsLLM Agent Skill Learning

  19. The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

    Aug 6, 2026Zhiheng Wang, Bo Peng, Lai Wei +1Tool Use in VLMsVisually Grounded Reasoning

  20. Beacon: Knowing When and How to Perform Agentic Visual Reasoning

    Jul 30, 2026Qixun Wang, Yang Shi, Letian Cheng +11Tool Use in VLMsRL for VLMs

  21. FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Self-Verification

    Jul 30, 2026Haoqing Wang, Xingrun Xing, Ziheng Li +2Tool Use in VLMsVLM Reasoning

  22. SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

    Jul 30, 2026Yang Zhou, Zixuan Huang, Sunzhu Li +10Tool Use in VLMsVisual Spatial Reasoning

  23. Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing

    Jul 28, 2026Fengxiang Wang, Jiangnan Huang, Mingshuo Chen +8Remote Sensing Image UnderstandingRemote Sensing VQA

  24. CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding

    Jul 27, 2026Jinlong Yang, Wenhao Zhang, Kuanwei Lin +1Tool Use in VLMsEfficient VLM Inference