AI Agent Reliability

Momentum

34 papers in the last four weeks, up 240% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 215

All topics
CardsList
  1. Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures

    Jul 31, 2026Isham Kalappurackal Mansoor, Abhishek Phadke, Pratip RanaAI Agent ReliabilityLLM Tool Use

  2. InfraBench: Evaluating Infrastructure Agents Across Layers, Lifecycle, and Risk

    Jul 31, 2026Yuan Gao, Zeren Yang, Junnan Li +6AI Agent ReliabilityAI Agent Evaluation

  3. One Human, NN Agents: Audit-Budget Allocation for LLM Agent Fleets under Miscalibrated, Correlated Confidence

    Jul 30, 2026Cesare Zavattari, Alessandro Tommasi, Giuseppe PrencipeScalable OversightAI Agent Reliability

  4. ΣΣ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems

    Jul 30, 2026Peilin Feng, Suorong Yang, Soujanya PoriaAI Agent ReliabilityMulti-Agent LLM Systems

  5. Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

    Jul 29, 2026Amirmohammad Farzaneh, Osvaldo SimeoneLLM Inference EfficiencyAI Agent Reliability

  6. Flat Score, Amplified Failures: How the Error Budget Masks Damage in Quantized LLM Agents

    Jul 29, 2026Jiwon Jang, Kisu Yang, Heuiseok Lim +1AI Agent ReliabilityBenchmark Design

  7. Living-Harness Is an Interactive-Agent Evolver

    Jul 29, 2026Yuetian Du, Yucheng Wang, He Xu +9AI Agent ReliabilityAgent Harness Optimization

  8. Stress-testing large language model agents in a robotic chemistry laboratory

    Jul 25, 2026Lulu Guo, Yingkai Sun, Xiaobo Li +13AI Agent ReliabilityAI Agents for Scientific Discovery

  9. Toward Continuous Assurance for the Democratization of AI Agent Creation in Industry

    Jul 23, 2026Natan Levy, Harel BergerAI Agent ReliabilityAI Agent Monitoring

  10. GuardianAgentBench: Where Agents Fail and How to Guard Them

    Jul 23, 2026Vishal Ishwar Naik, Chenyu Xu, Donna Dong +5AI Agent ReliabilityLLM Guardrails

  11. Agents in the Wild: Where Research Meets Deployment

    Jul 21, 2026Grace Hui Yang, Pranav N. Venkit, Hooman Sedghamiz +3AI Agent ReliabilityMulti-Agent LLM Systems

  12. AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

    Jul 21, 2026Kunlun Zhu, Xuyan Ye, Zhiguang Han +9Agent Failure AnalysisAI Agent Reliability

  13. Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data

    Jul 20, 2026Nursultan Askarbekuly, Mohamad Al Mdfaa, Ahmed Helaly +2AI Agent ReliabilityReward Hacking

  14. Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents

    Jul 20, 2026Yitao Wu, Si Shen, Rui Yang +2AI Agent ReliabilityLLM Self-Correction

  15. DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments

    Jul 19, 2026Jun Nie, Zhiqin Yang, Zhenheng Tang +4AI Agent ReliabilityDeep Research Agents

  16. Teach it to stop, not just to click

    Jul 19, 2026Barada Sahu, Shivesh PandeyAI Agent ReliabilityAgent Reliability

  17. AI Agents Do Not Fail Alone:The Context Fails First

    Jul 15, 2026Fouad BousetouaneAI Agent ReliabilityAgent Reliability

  18. DeepStress: Stress-Testing Deep Search Agents

    Jul 15, 2026Ismael Rousseau, Geraldine Damnati, Frederic BechetAI Agent ReliabilityAI Agent Evaluation

  19. Critic Experience Bank: Self-Evolving Step-Level Confidence Estimation for LLM Agents

    Jul 14, 2026Yaopei Zeng, Congchao Wang, JianHang Chen +3AI Agent ReliabilityLLM Agent Evaluation