AI Agent Reliability

Momentum

34 papers in the last four weeks, up 278% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 213

All topics
CardsList
  1. A Case Study in Assuring AI-Written Software

    Oct 6, 2026Lindsey Ferris, Sierra BonillaAI Agent ReliabilityAI Assurance

  2. AgentSpy: Making AI Agent Behavior Observable

    Oct 5, 2026Christoph Bühler, Matteo Biagiola, Luca Di Grazia +1AI Agent ReliabilityAI Agent Auditing

  3. AECG: Asymmetric Experience Consolidation and Governance In Multi-Agent Systems

    Oct 4, 2026Ao Tian, Jialong Liu, Daqi Zheng +7AI Agent ReliabilityMulti-Agent LLM Systems

  4. Agents Are Systems, Not Models: Rethinking Agentic Evaluation

    Oct 1, 2026Luis Wiedmann, Leander Girrbach, Cordelia Schmid +1AI Agent ReliabilityAI Agent Evaluation

  5. Right Answers, Wrong States: Hidden Information Failures in Multi-Agent Collaboration

    Oct 1, 2026Herun Wan, Jiaying Wu, Minnan Luo +4AI Agent ReliabilityMulti-Agent Collaboration

  6. YouRA: A Persistent-State Architecture for Evidence-Traceable Autonomous Research Agents

    Oct 1, 2026Yoonkyu Woo, Woojin Lee, Jin-Xia HuangAI Agent ReliabilityAI Agents for Scientific Discovery

  7. Empty Commitments: When Agents Promise What Their Runtime Cannot Deliver

    Oct 1, 2026Jiaqi Tang, Lan Wei, Bingyu Shen +1AI Agent ReliabilityLLM Agent Evaluation

  8. AgBench: Agentic AI Benchmarks for Personal AI Devices

    Sep 29, 2026Yizhou Han, Di Wu, Dhananjay Saikumar +1AI Agent ReliabilityAI Agent Evaluation

  9. The Backdrop Exposes What the World Around an Agent Costs It

    Sep 29, 2026Nusrat Jahan Lia, Shubhashis Roy DiptaAI Agent ReliabilityPrompt Injection Attacks on AI Agents

  10. Reliability Engineering for AI Systems: Challenges, Methods, and Directions

    Sep 28, 2026Rong Pan, Yili Hong, Min XieAI Agent ReliabilityAI Safety Evaluation

  11. BIABench: Evaluating AI agents on real-world bioimage analysis tasks

    Sep 28, 2026Zixuan Pan, Davide Panzeri, Lukas Johanns +5AI Agent ReliabilityAI Agent Evaluation

  12. DISCERN: Can AI Agents Work Like Scientists and Guide Discovery?

    Sep 27, 2026Nan Huang, Mario Tapia-Pacheco, Kun Zhou +4AI Agent ReliabilityScientific Hypothesis Generation

  13. CORTEX: A Verified Experience Layer for Generalist Agents

    Sep 27, 2026Garapati Keerthana, Manik GuptaAI Agent ReliabilityLifelong Learning Agents

  14. AquaMend: Minimal Re-probing and Conditional Rollback for Latent-Belief Failures in Embodied Agents

    Sep 24, 2026Yufan Liu, Shang Luo, Yang Liu +9Belief-Space PlanningAI Agent Reliability

  15. Governed AI-Agent Coordination for Dementia Care: Architecture, Safety Contracts, and Evidence-Derived Workflow Verification

    Sep 22, 2026Francesca Medda, Hui GongAI Agent ReliabilityHealthcare

  16. Risk-Aware Online Conformal State Probing

    Sep 22, 2026Pietro Talli, Petar Popovski, Osvaldo SimeoneAI Agent ReliabilityConformal Prediction

  17. Quantifying Overclaiming Propensity in Frontier LLM Agents

    Sep 17, 2026Nolan Smyth, Yorguin-Jose Mantilla-Ramos, Pascal Jr Tikeng Notsawo +6AI Agent ReliabilityAI Coding Agents

  18. Neuro-Symbolic Agentic AI for Networked Low-Altitude UAVs

    Sep 17, 2026Yuqi Ping, Tianhao Liang, Nanchi Su +4AI Agent ReliabilityAerial Robotics

  19. Locating Hidden Failures Makes Long-Horizon Agents More Reliable

    Sep 15, 2026Salman Rahman, Yubin Kim, Mihir Parmar +15Agent Failure AnalysisAI Agent Reliability

  20. ERPBench: A State-Grounded Evaluation Paradigm for Computer-Use Agents in Enterprise Software

    Sep 15, 2026Kratika Bhagtani, Kusha Sridhar, Maziyar Baran Pouyan +2Computer-Use Agent BenchmarksAI Agent Reliability

  21. Agentic Societies Need a Social Harness

    Sep 15, 2026Tapan Chugh, Vidushi Singh, Krish Jain +2AI Agent ReliabilityMulti-Agent System Security

  22. Agent-Integrated Software: Interaction Contracts and Continuous Assurance

    Sep 12, 2026Shengcheng Yu, Chunrong Fang, Zhenyu ChenAI Agent ReliabilityHuman-AI Interaction

  23. Finishing the Task Is Not Enough: Evaluating Agent Resilience and Considerate Participation under Accumulating Challenge

    Sep 12, 2026Yuanchen Bai, Zijian Ding, Angelique TaylorAI Agent ReliabilityAgent Reliability

  24. Vision: Data-Centric Anchoring for Robust and Interpretable Agentic AI

    Sep 8, 2026Arun Vignesh Malarkkan, Xinyuan Wang, Yanjie FuAI Agent ReliabilityDistribution Shift

  25. CIVI: A Framework for Diagnosing Search Agent Failures in Civic Information

    Sep 8, 2026Dingying Liu, Yunshun Zhong, Wentao Zhang +1Agent Failure AnalysisAI Agent Reliability

  26. Remember and Reweight: Enhancing Multi-Agent Debate with Experience Memory and Confidence Estimation

    Sep 3, 2026Xuanfa Jin, Zhijian Ma, Yongcheng Zeng +3AI Agent ReliabilityMulti-Agent Debate

  27. Robustness Analysis of Agentic AI to Inconsistent and Incomplete Tool Responses

    Aug 24, 2026Jiachen Xu, Torben Bach Pedersen, Zhongming Yao +2Agent Failure AnalysisAI Agent Reliability

  28. Agent Behavioral Contracts II: Certifying Compositional Reliability Without Assuming Independence

    Aug 13, 2026Varun Pratap Bhardwaj, Garima Singh, Arun Pratap BhardwajAgent Failure AnalysisAI Agent Reliability

  29. Software Engineering for and with GUI Agent

    Aug 10, 2026Shengcheng Yu, Yuchen Ling, Junyang Xing +3AI Agent ReliabilityGUI Agents

  30. CyberAGENTS: Structured Autonomy for Agentic Gamified Learning in Cybersecurity

    Aug 8, 2026Ivan Hornung, Deepthi Marasinghe Arachchige, Tharindu Kumarage +4AI Agent ReliabilityEducational Technology

  31. SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents

    Aug 5, 2026Zhixiang Liang, Yifei Liu, Yidan Huang +5Agent Failure AnalysisAI Agent Reliability

  32. SafeCommit: Certifying When Memory-Grounded Agents May Safely Act

    Aug 4, 2026Mayur Akewar, Ravi RanjanAgent MemoryAI Agent Reliability

  33. Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems

    Aug 4, 2026Sebastián Andrés Cajas Ordóñez, Agastya Munnangi, Aldo Marzullo +13AI Agent ReliabilityMulti-Agent LLM Systems

  34. PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise

    Aug 3, 2026Abdulrahman AlRabah, Xiaocheng Yang, Dilek Hakkani-Tür +1AI Agent ReliabilityAI-Assisted Decision Making

  35. Control Under Compression: Reliability Frontiers for Tool-Using Agents

    Aug 2, 2026Yinghan Hou, Zongyou YangAI Agent ReliabilityAI Agent Benchmarks

  36. DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning

    Aug 1, 2026An Lanji, Dawei Liu, Jin Li +3AI Agent ReliabilityVLM Interpretability

  37. Measuring Cross-Task Behavioral Consistency in Language Model Agents

    Jul 31, 2026Amritesh Banerjee, Pranil RaichuraAI Agent ReliabilitySoftware Engineering Agents

  38. Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures

    Jul 31, 2026Isham Kalappurackal Mansoor, Abhishek Phadke, Pratip RanaAI Agent ReliabilityLLM Tool Use

  39. InfraBench: Evaluating Infrastructure Agents Across Layers, Lifecycle, and Risk

    Jul 31, 2026Yuan Gao, Zeren Yang, Junnan Li +6AI Agent ReliabilityAI Agent Evaluation