Tool-Using Language Agents

Momentum

9 papers in the last four weeks, up 200% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 44

All topics
CardsList
  1. AgentHop: A Diagnostic Benchmark for Agentic Multi-Hop Scientific Question Answering

    Sep 28, 2026Chanhee Park, Jeongho Yoon, Sungbin Han +2Multi-Hop QATool-Augmented Language Model Agents

  2. SALMONN-duo: Adaptive Dual-System Coordination for Full-Duplex Voice Agents

    Sep 28, 2026Wenyi Yu, Siyin Wang, Terumi Chiba +5LLM Agent OrchestrationTool-Using Language Agents

  3. Learning from Failures: Heterogeneous Graph Memory for Small Language Model Tool-Using Agents

    Sep 23, 2026Jiaxing Li, Lei Song, Rui Dong +1Graph-Based Agent MemoryLong-Horizon LLM Agents

  4. Salesforce Koa: An Enterprise Language Model for Agentic Tool Use

    Sep 14, 2026Zixiang Chen, Sufeng Niu, Yingchi Liu +22Tool-Augmented Language Model AgentsLanguage Modeling

  5. Fabrication After Tool Failure: Tool-Augmented Agents Assert Values Their Tools Did Not Return

    Sep 13, 2026Arham Sethi, Arsen Kenzhebayev, Saanvi Paturi +3Tool-Augmented Language Model AgentsDeception in Language Models

  6. The Menu Is an Execution Prior: State-Path Tool Menus for Online Agents

    Sep 10, 2026Bo Yan, Weikai Lin, Song WangTool-Using AgentsLLM Tool Use

  7. Harness Engineering in LLM Tool Use via Agent-Native Reusable Tool Primitives

    Sep 1, 2026Haibo Jin, Suijin Wang, Xucheng Yu +2Tool-Augmented Language Model AgentsLLM Agent Orchestration

  8. You Know What I Mean: A Benchmark for Agentic Conversational Reference Grounding

    Aug 30, 2026Karen Fuchs, Uri Katz, Yoav GoldbergSoftware Engineering AgentsAgentic Retrieval

  9. TraceCompiler: Skill-Guided Mining and Compilation of LLM Agent Traces into Mostly Deterministic Workflows

    Aug 3, 2026Salma El Yadouni, Guanyi LiAgentic WorkflowsLLM-Based Program Synthesis

  10. Scores Are Not Decisions: Cost-Aware Stopping for Tool Acquisition in LLM Agents

    Jul 29, 2026Yicheng Feng, Yan Zhang, Yan Cheng +1Decision-Focused LearningTool-Using Agents

  11. Tools Are Not Islands: Set-Level Tool Retrieval for LLM Agents via Query-Conditioned Hyperedge Prediction

    Jul 28, 2026Xinyi Hong, Pinjun Dong, Xinyang Yu +1Tool-Augmented Language Model AgentsLLM Tool Use

  12. GuardianAgentBench: Where Agents Fail and How to Guard Them

    Jul 23, 2026Vishal Ishwar Naik, Chenyu Xu, Donna Dong +5AI Agent ReliabilityLLM Guardrails

  13. Scalable LLM Agent Tool Access in the Cloud

    Jul 17, 2026Mingxin Li, Enge Song, Yueshang Zuo +27LLM Tool UseModel Context Protocol

  14. Cross-Layer Misalignment Detection in Agent Skills: A Progressive Loading-Aware Contrastive Learning Approach

    Jul 12, 2026Chengjun Zhang, Yang Gao, Jianna Hur +2Contrastive LearningTool-Using Language Agents

  15. DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers

    Jul 10, 2026Jerzy Kamiński, Ilya Galyukshev, Artem Kuznetsov +4Computer-Use Agent BenchmarksLLM Agent Evaluation

  16. Entity Binding Failures in Tool-Augmented Agents

    Jun 29, 2026Rahul Suresh Babu, Shashank IndukuriTool-Using AgentsLLM Agent Safety

  17. CacheRL:Multi-Turn Tool-Calling Agents via Cached Rollouts and Hybrid Reward

    Jun 12, 2026Md Amirul Islam, Sumiran Thakur, Huancheng Chen +3LLM Agent TrainingTool-Using Language Agents

  18. From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents

    Jun 9, 2026Yifan Li, Shengbin Yue, Boyu Feng +6LLM Agent EvaluationAI Agent Benchmarks

  19. ToolChoiceConfusion: Causal Minimal Tool Filtering for Reliable LLM Agents

    Jun 4, 2026Rahul Suresh Babu, Laxmipriya Ganesh IyerAI Agent ReliabilityTool-Use Evaluation

  20. AURA: Intent-Directed Probing for Implicit-Need Surfacing in Situated LLM Agents

    Jun 4, 2026Yang Li, Jiaxiang Liu, Jiang Cai +1LLM Agent EvaluationIntent Classification

  21. SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale

    Jun 2, 2026Tong Bai, Zhenglin Wan, Pengfei Zhou +3LLM Agent Skill RetrievalDynamic Graph Learning

  22. MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation

    Jun 1, 2026Wenhao Wang, Peizhi Niu, Gongyi Zou +9LLM Agent EvaluationAI Agent Benchmarks

  23. Sophrosyne: Agentic Exploration of Relational Data Systems Needs Moderation

    May 29, 2026Madhav Jivrajani, Ramnatthan Alagappan, Aishwarya GanesanText-to-SQLTool-Using Language Agents

  24. SkillsInjector: Dynamic Skill Context Construction for LLM Agents

    May 28, 2026Yanchao Li, Wanhao Liu, Ben Gao +5Tool-Augmented Language Model AgentsLLM Agent Skill Learning

  25. Diagnosis Is Not Prescription: Linguistic Co-Adaptation Explains Patching Hazards in LLM Pipelines

    May 21, 2026Yoon Jeonghun, Kim DongchanLLM AgentsCausal Interventions in Language Models

  26. Internalizing Tool Knowledge in Small Language Models via QLoRA Fine-Tuning

    May 18, 2026Yuval Shemla, Ayal Yakobe, Tanmay Agarwal +2Small Language ModelsLLM Tool Use

  27. RunAgent: Interpreting Natural-Language Plans with Constraint-Guided Execution

    May 1, 2026Arunabh Srivastava, Mohammad A., Khojastepour +2Multi-Agent LLM SystemsTool-Using Language Agents

  28. AgentFloor: How Far Up the tool use Ladder Can Small Open-Weight Models Go?

    May 1, 2026Ranit Karmakar, Jayita ChatterjeeComputer-Use Agent BenchmarksLLM Agent Evaluation

  29. ComPASS: Towards Personalized Agentic Social Support via Tool-Augmented Companionship

    Apr 20, 2026Zhaopei Huang, Yanfeng Jia, Jiayi Zhao +3AI CompanionsAI Agent Benchmarks

  30. PersonalHomeBench: Evaluating Agents in Personalized Smart Homes

    Apr 18, 2026Manasa Bharadwaj, Yolanda Liu, InJung Yang +5AI Agent EvaluationMultimodal Agents

  31. Understanding Tool-Augmented Agents for Lean Formalization: A Factorial Analysis

    Apr 16, 2026Ke Zhang, Patricio Gallardo, Maziar Raissi +1Code TranslationLLM Agent Evaluation