LLM Agent Reliability

LLM: Large Language Model

Momentum

90 papers in the last four weeks, up 109% on the four weeks before. 0.9% of all new papers.

Jul 13Week of Sep 28

Latest papers 558

All topics
CardsList
  1. Don't Blindly Trust It: How Unreliable Feedback Breaks Tool-Using LLM Agents

    Jun 19, 2026Chubin Zhang, Zhenglin Wan, Xingrui Yu +5AI Agent ReliabilityTool-Use Evaluation

  2. LedgerAgent: Structured State for Policy-Adherent Tool-Calling Agents

    Jun 18, 2026Md Nayem Uddin, Amir Saeidi, Eduardo Blanco +1Tool-Augmented Language Model AgentsCustomer Support Automation

  3. Dual-Agent Framework for Cross-Model Verified Translation of Natural-Language Protocols into Robotic Laboratory Platform

    Jun 18, 2026Hyeonna Choi, Jung Yup Kim, Hyuneui Lim +1LLM Agent OrchestrationLaboratory Automation

  4. Human-on-the-Loop Orchestration for AI-Assisted Legal Discovery

    Jun 18, 2026Anushree Sinha, Srivaths Ranganathan, Abhishek Dharmaratnakar +1Legal IRLLM Agent Orchestration

  5. Uncertainty Decomposition for Clarification Seeking in LLM Agents

    Jun 17, 2026Gregory MatsnevLLM AgentsLLM Uncertainty Estimation

  6. Written by AI, Managed by AI: Semantic Space Control and Index Sickness Elimination Across 391 Consecutive Sessions

    Jun 17, 2026Hui Zhang, Shuren SongLong-Horizon LLM AgentsLLM Context Management

  7. ToolChain-CRC: Conformal Risk Control for Agentic AI Under Retrieval and Tool-Use Drift

    Jun 16, 2026Jeffery Opoku, David BanaheneAI Agent ReliabilityDistribution Shift

  8. Intelligence Entropy Principle and the ADE Stability Engineering Framework

    Jun 16, 2026Dexing LiuAgent Failure AnalysisMulti-Agent LLM Systems

  9. ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents

    Jun 16, 2026Ander Alvarez, Santhiya Rajan, Samuel Mugel +1LLM Answer VerificationData Provenance

  10. SEAGym: An Evaluation Environment for Self-Evolving LLM Agents

    Jun 16, 2026Congjie Zheng, Chuanyi Xue, Bin Liang +2LLM Agent EvaluationAI Agent Benchmarks

  11. MemTrace: Probing What Final Accuracy Misses in Long-Term Memory

    Jun 15, 2026Xianxuan Long, Zhikai Chen, Shenglai Zeng +3Temporal Reasoning in Language ModelsLLM Agent Memory

  12. How Much Can We Trust LLM Search Agents? Measuring Endorsement Vulnerability to Web Content Manipulation

    Jun 15, 2026Yimeng Chen, Zhe Ren, Firas Laakom +3LLM Agent EvaluationAI Agent Security

  13. GIST-CMTF: Goal-State Inference for Causal Minimal Tool Filtering in LLM Agents

    Jun 15, 2026Rahul Suresh Babu, Rohit ShuklaClarification Question GenerationTool-Using Agents

  14. Misinformation Propagation in Benign Multi-Agent Systems

    Jun 15, 2026Jonas Becker, Jan Philip Wahle, Terry Ruas +1Multi-Agent DebateMulti-Agent Communication

  15. VeriGraph: Towards Verifiable Data-Analytic Agents

    Jun 15, 2026Jiajie Jin, Zhao Yang, Wenle Liao +5Data ProvenanceNeuro-Symbolic Reasoning

  16. DeepRoot: A KG-Coordinated Multi-Agent System for Therapeutic Reasoning over Historical Medical Texts

    Jun 14, 2026Zijian Carl Ma, Sean J. Wang, Sijbren Kramer +1Historical Document AnalysisMulti-Agent LLM Systems

  17. LLM-as-Code: Agentic Programming for Agent Harness

    Jun 14, 2026Junjia Qi, Zichuan Fu, Jingtong Gao +4AI Agent ReliabilityLLM Agent Orchestration

  18. From Question Answering to Task Completion: A Survey on Agent System and Harness Design

    Jun 14, 2026Jianyuan Guo, Zhiwei Hao, Chengcheng Wang +14LLM Agent EvaluationLLM Agents

  19. Resilient Consensus in Agentic AI

    Jun 12, 2026Sribalaji C. Anand, George J. PappasMulti-Agent LLM SystemsMulti-Agent Consensus

  20. PhoneHarness: Harnessing Phone-Use Agents through Mixed GUI, CLI, and Tool Actions

    Jun 12, 2026Chenxin Li, Zhengyao Fang, Zhengyang Tang +18Mobile GUI AutomationTool-Using Agents