AI Agent Reliability

Momentum

34 papers in the last four weeks, up 240% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 215

All topics
CardsList
  1. Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures

    Jul 31, 2026Isham Kalappurackal Mansoor, Abhishek Phadke, Pratip RanaAI Agent ReliabilityLLM Tool Use

  2. InfraBench: Evaluating Infrastructure Agents Across Layers, Lifecycle, and Risk

    Jul 31, 2026Yuan Gao, Zeren Yang, Junnan Li +6AI Agent ReliabilityAI Agent Evaluation

  3. One Human, NN Agents: Audit-Budget Allocation for LLM Agent Fleets under Miscalibrated, Correlated Confidence

    Jul 30, 2026Cesare Zavattari, Alessandro Tommasi, Giuseppe PrencipeScalable OversightAI Agent Reliability

  4. ΣΣ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems

    Jul 30, 2026Peilin Feng, Suorong Yang, Soujanya PoriaAI Agent ReliabilityMulti-Agent LLM Systems

  5. Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

    Jul 29, 2026Amirmohammad Farzaneh, Osvaldo SimeoneLLM Inference EfficiencyAI Agent Reliability

  6. Flat Score, Amplified Failures: How the Error Budget Masks Damage in Quantized LLM Agents

    Jul 29, 2026Jiwon Jang, Kisu Yang, Heuiseok Lim +1AI Agent ReliabilityBenchmark Design

  7. Living-Harness Is an Interactive-Agent Evolver

    Jul 29, 2026Yuetian Du, Yucheng Wang, He Xu +9AI Agent ReliabilityAgent Harness Optimization

  8. Stress-testing large language model agents in a robotic chemistry laboratory

    Jul 25, 2026Lulu Guo, Yingkai Sun, Xiaobo Li +13AI Agent ReliabilityAI Agents for Scientific Discovery

  9. Toward Continuous Assurance for the Democratization of AI Agent Creation in Industry

    Jul 23, 2026Natan Levy, Harel BergerAI Agent ReliabilityAI Agent Monitoring

  10. GuardianAgentBench: Where Agents Fail and How to Guard Them

    Jul 23, 2026Vishal Ishwar Naik, Chenyu Xu, Donna Dong +5AI Agent ReliabilityLLM Guardrails

  11. Agents in the Wild: Where Research Meets Deployment

    Jul 21, 2026Grace Hui Yang, Pranav N. Venkit, Hooman Sedghamiz +3AI Agent ReliabilityMulti-Agent LLM Systems

  12. AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

    Jul 21, 2026Kunlun Zhu, Xuyan Ye, Zhiguang Han +9Agent Failure AnalysisAI Agent Reliability

  13. Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data

    Jul 20, 2026Nursultan Askarbekuly, Mohamad Al Mdfaa, Ahmed Helaly +2AI Agent ReliabilityReward Hacking

  14. Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents

    Jul 20, 2026Yitao Wu, Si Shen, Rui Yang +2AI Agent ReliabilityLLM Self-Correction

  15. DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments

    Jul 19, 2026Jun Nie, Zhiqin Yang, Zhenheng Tang +4AI Agent ReliabilityDeep Research Agents

  16. Teach it to stop, not just to click

    Jul 19, 2026Barada Sahu, Shivesh PandeyAI Agent ReliabilityAgent Reliability

  17. AI Agents Do Not Fail Alone:The Context Fails First

    Jul 15, 2026Fouad BousetouaneAI Agent ReliabilityAgent Reliability

  18. DeepStress: Stress-Testing Deep Search Agents

    Jul 15, 2026Ismael Rousseau, Geraldine Damnati, Frederic BechetAI Agent ReliabilityAI Agent Evaluation

  19. Critic Experience Bank: Self-Evolving Step-Level Confidence Estimation for LLM Agents

    Jul 14, 2026Yaopei Zeng, Congchao Wang, JianHang Chen +3AI Agent ReliabilityLLM Agent Evaluation

  20. AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP

    Jul 13, 2026Aritra Mazumder, Nusrat jahan LiaAI Agent ReliabilityLLM Agent Evaluation

  21. AgentAbstain: Do LLM Agents Know When Not to Act?

    Jul 11, 2026Xun Liu, Yi Evie Zhang, Vira Kasprova +5AI Agent ReliabilityLLM Agent Evaluation

  22. Scoped Verification for Reliable Long-Horizon Agentic Context Evolution under Distribution Shift

    Jul 10, 2026Dan C. Hsu, Luke LuAI Agent ReliabilityLong-Horizon Agent Evaluation

  23. Agent Delivery Engineering Predictive Reliability Framework

    Jul 8, 2026Dexing LiuAI Agent ReliabilityMulti-Agent LLM Systems

  24. Reason Less, Verify More: Deterministic Gates Recover a Silent Policy-Violation Failure Mode in Tool-Using LLM Agents

    Jul 8, 2026Vikas Reddy, Sumanth Reddy Challaram, Abhishek BasuAgent Failure AnalysisAI Agent Reliability

  25. Agentic Data Environments

    Jul 8, 2026Elaine Ang, Chenxi Huang, Georgios Liargkovas +13AI Agent ReliabilityAI Agent Safety

  26. The "I Don't Know" Filter: Enhancing Agentic Reliability in Function Calling

    Jul 4, 2026Stefan Broecker, Mason del Rosario, Boris Selitser +1AI Agent ReliabilityLLM Agent Evaluation

  27. When the Database Fails: Prompting LLM Dialogue Agents for Safe Recovery in Task-Oriented Dialogue

    Jun 30, 2026Mohammad Alijanpour Shalmani, Alale Rezvani Boroujeni, Jiann Shiun YuanAI Agent ReliabilityLLM Hallucination Mitigation

  28. Certified Speculative Execution for Untrusted AI Agents

    Jun 30, 2026Chenyu Zhou, Qiliang Jiang, Shuning Wu +1AI Agent ReliabilityConstrained RL

  29. SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution

    Jun 29, 2026Aojie Yuan, Yi Nian, Haiyue Zhang +2AI Agent ReliabilityProcess Reward Models

  30. Budgeted Act-or-Defer Multi-Agent LLM Deliberation with Local Reliability Bounds

    Jun 28, 2026Mengdie Flora Wang, Haochen Xie, Guanghui Wang +2AI Agent ReliabilityMulti-Agent LLM Systems

  31. Preventing Error Propagation in Multi-Agent AI through Runtime Monitoring

    Jun 27, 2026Shahnewaz Karim Sakib, Anindya Bijoy DasAI Agent ReliabilityMulti-Agent Systems

  32. Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability

    Jun 24, 2026Yang Tian, Zhengpeng Shi, Yu Zhou +1AI Agent ReliabilityAI Agent Benchmarks

  33. Position: Correct Answer, Wrong Mechanism -- When AI Scientists Defend General Claims Their Own Data Contradicts

    Jun 22, 2026Steven Young EuligAI Agent ReliabilityReasoning Evaluation

  34. Don't Blindly Trust It: How Unreliable Feedback Breaks Tool-Using LLM Agents

    Jun 19, 2026Chubin Zhang, Zhenglin Wan, Xingrui Yu +5AI Agent ReliabilityTool-Use Evaluation