AI Agent Reliability

Momentum

34 papers in the last four weeks, up 240% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 215

All topics
CardsList
  1. A Case Study in Assuring AI-Written Software

    Oct 6, 2026Lindsey Ferris, Sierra BonillaAI Agent ReliabilityAI Assurance

  2. AgentSpy: Making AI Agent Behavior Observable

    Oct 5, 2026Christoph Bühler, Matteo Biagiola, Luca Di Grazia +1AI Agent ReliabilityAI Agent Auditing

  3. AECG: Asymmetric Experience Consolidation and Governance In Multi-Agent Systems

    Oct 4, 2026Ao Tian, Jialong Liu, Daqi Zheng +7AI Agent ReliabilityMulti-Agent LLM Systems

  4. Agents Are Systems, Not Models: Rethinking Agentic Evaluation

    Oct 1, 2026Luis Wiedmann, Leander Girrbach, Cordelia Schmid +1AI Agent ReliabilityAI Agent Evaluation

  5. Right Answers, Wrong States: Hidden Information Failures in Multi-Agent Collaboration

    Oct 1, 2026Herun Wan, Jiaying Wu, Minnan Luo +4AI Agent ReliabilityMulti-Agent Collaboration

  6. YouRA: A Persistent-State Architecture for Evidence-Traceable Autonomous Research Agents

    Oct 1, 2026Yoonkyu Woo, Woojin Lee, Jin-Xia HuangAI Agent ReliabilityAI Agents for Scientific Discovery

  7. Empty Commitments: When Agents Promise What They Cannot Deliver

    Oct 1, 2026Jiaqi Tang, Bingyu Shen, Lan Wei +6AI Agent ReliabilityLLM Agent Evaluation

  8. AgBench: Agentic AI Benchmarks for Personal AI Devices

    Sep 29, 2026Yizhou Han, Di Wu, Dhananjay Saikumar +1AI Agent ReliabilityAI Agent Evaluation

  9. The Backdrop Exposes What the World Around an Agent Costs It

    Sep 29, 2026Nusrat Jahan Lia, Shubhashis Roy DiptaAI Agent ReliabilityPrompt Injection Attacks on AI Agents

  10. Reliability Engineering for AI Systems: Challenges, Methods, and Directions

    Sep 28, 2026Rong Pan, Yili Hong, Min XieAI Agent ReliabilityAI Safety Evaluation

  11. BIABench: Evaluating AI agents on real-world bioimage analysis tasks

    Sep 28, 2026Zixuan Pan, Davide Panzeri, Lukas Johanns +5AI Agent ReliabilityAI Agent Evaluation

  12. DISCERN: Can AI Agents Work Like Scientists and Guide Discovery?

    Sep 27, 2026Nan Huang, Mario Tapia-Pacheco, Kun Zhou +4AI Agent ReliabilityScientific Hypothesis Generation

  13. CORTEX: A Verified Experience Layer for Generalist Agents

    Sep 27, 2026Garapati Keerthana, Manik GuptaAI Agent ReliabilityLifelong Learning Agents

  14. AquaMend: Minimal Re-probing and Conditional Rollback for Latent-Belief Failures in Embodied Agents

    Sep 24, 2026Yufan Liu, Shang Luo, Yang Liu +9Belief-Space PlanningAI Agent Reliability

  15. Governed AI-Agent Coordination for Dementia Care: Architecture, Safety Contracts, and Evidence-Derived Workflow Verification

    Sep 22, 2026Francesca Medda, Hui GongAI Agent ReliabilityHealthcare

  16. Risk-Aware Online Conformal State Probing

    Sep 22, 2026Pietro Talli, Petar Popovski, Osvaldo SimeoneAI Agent ReliabilityConformal Prediction

  17. Quantifying Overclaiming Propensity in Frontier LLM Agents

    Sep 17, 2026Nolan Smyth, Yorguin-Jose Mantilla-Ramos, Pascal Jr Tikeng Notsawo +6AI Agent ReliabilityAI Coding Agents

  18. Neuro-Symbolic Agentic AI for Networked Low-Altitude UAVs

    Sep 17, 2026Yuqi Ping, Tianhao Liang, Nanchi Su +4AI Agent ReliabilityAerial Robotics

  19. Locating Hidden Failures Makes Long-Horizon Agents More Reliable

    Sep 15, 2026Salman Rahman, Yubin Kim, Mihir Parmar +15Agent Failure AnalysisAI Agent Reliability

  20. ERPBench: A State-Grounded Evaluation Paradigm for Computer-Use Agents in Enterprise Software

    Sep 15, 2026Kratika Bhagtani, Kusha Sridhar, Maziyar Baran Pouyan +2Computer-Use Agent BenchmarksAI Agent Reliability

  21. Agentic Societies Need a Social Harness

    Sep 15, 2026Tapan Chugh, Vidushi Singh, Krish Jain +2AI Agent ReliabilityMulti-Agent System Security