Tool-Using Agents

Momentum

31 papers in the last four weeks, up 210% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 199

All topics
CardsList
  1. IACM-RL: Intent-Aware Context Management and Reinforcement Learning for Complex Tool Invocation under Dynamic Intent Fluctuations

    Aug 3, 2026Dingwei Zhu, Jiahan Li, Chengjun Pan +22Tool-Using AgentsRobust RL

  2. Towards the Harness of Embodied Agents

    Aug 3, 2026Qi Wang, Tianyi Wang, Chengyang Li +6Tool-Using AgentsLong-Horizon Agent Tasks

  3. Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

    Aug 3, 2026Yuwen Wang, Tian-Hao Zhang, Minghao Cai +7Tool-Augmented Language Model AgentsAgent Evaluation

  4. Control Under Compression: Reliability Frontiers for Tool-Using Agents

    Aug 2, 2026Yinghan Hou, Zongyou YangAI Agent ReliabilityAI Agent Benchmarks

  5. Learning to Coordinate Symbolic Tools: LLM Agents for Verified Sum-of-Squares Certificates

    Jul 31, 2026Bohan Chen, Shivam N. Patel, Richard Hoffmann +2LLM Agent VerificationTool-Using Agents

  6. CAGE: Certified Authorization under Typed-Return Uncertainty for Tool-Using Agents

    Jul 31, 2026Blaise Delattre, Cong Wang, Yang CaoLLM Agent SecurityTool-Using Agents

  7. VAmoS Bench: Voice Agent Simulation Bench

    Jul 29, 2026Joshua Meyer, Sahar Shayegan, Ritiz Tambi +5Voice Agent EvaluationCustomer Support Automation

  8. Scores Are Not Decisions: Cost-Aware Stopping for Tool Acquisition in LLM Agents

    Jul 29, 2026Yicheng Feng, Yan Zhang, Yan Cheng +1Decision-Focused LearningTool-Using Agents

  9. PUDA: An AI-Native Hardware Harness for Self-Driving Laboratories

    Jul 29, 2026Zekun Ren, Hongzhao Tan, Jiaen Yee +1Laboratory AutomationTool-Using Agents

  10. Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL

    Jul 28, 2026Jiabao Ji, Yujian Liu, Li An +4Tool-Using AgentsLLM Agent Training

  11. WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing

    Jul 28, 2026Hao Liang, Meiyi Qiang, Sizhe Qiu +2Computer-Use Agent BenchmarksAI Agent Benchmarks

  12. NVIDIA-labs OO Agents: Native Python Object-Oriented Agents

    Jul 22, 2026Paul Furgale, Severin Klingler, James Nolan +12LLM Agent OrchestrationTool-Using Agents

  13. Clarify Before Executing: A Self-Evolving Agent for Resolving Intent Asymmetry in 3D Tool Orchestration

    Jul 17, 2026Xiaoye Zhu, Weixin Li, Junan Huo +53D Asset GenerationClarification Question Generation

  14. OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios

    Jul 16, 2026Chengyu Shen, Yujie Fu, Gangtao Xin +13Computer-Use Agent BenchmarksAI Agent Evaluation

  15. PalmClaw: A Native On-Device Agent Framework for Mobile Phones

    Jul 14, 2026Hongru Cai, Yongqi Li, Ran Wei +1Tool-Using AgentsLLM Agents

  16. ToFu: A White-Box, Token-Efficient Agent Harness for Researchers

    Jul 13, 2026Junhao Ruan, Yuan Ge, Bei Li +7Tool-Augmented Language Model AgentsSoftware Engineering Agents

  17. AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP

    Jul 13, 2026Aritra Mazumder, Nusrat jahan LiaAI Agent ReliabilityLLM Agent Evaluation

  18. When Does Restricting a Coding Agent to execute_code Help? A Regime ×\times Agent-Design Ablation

    Jul 12, 2026Hong Yang, Qi Yu, Travis DesellCoding AgentsTool-Using Agents

  19. AgentAbstain: Do LLM Agents Know When Not to Act?

    Jul 11, 2026Xun Liu, Yi Evie Zhang, Vira Kasprova +5AI Agent ReliabilityLLM Agent Evaluation

  20. Evaluating Generative Agents with Actions Grounded in Socially Distributed Task Environments using Incognita

    Jul 3, 2026Dan C. Hsu, Luke LuLLM Agent EvaluationAI Agent Benchmarks