Agent Reliability

Momentum

3 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 36

All topics
CardsList
  1. Incident-Arena: Getting agents to the last nine of reliability

    Sep 30, 2026Andre Fu, Malik Drabla, Leon Liu +5Agent ReliabilityAI Coding Agents

  2. Finishing the Task Is Not Enough: Evaluating Agent Resilience and Considerate Participation under Accumulating Challenge

    Sep 12, 2026Yuanchen Bai, Zijian Ding, Angelique TaylorAI Agent ReliabilityAgent Reliability

  3. Tempting the Agent: The Economics of Reputation without Persistent Identity in AI Agent Markets

    Sep 2, 2026Federico Gatta, Manuel Naviglio, Francesco TarantelliAgent ReliabilityAI Agent Governance

  4. AndroidReality: How Far Are Mobile Agents from the Real World?

    Aug 7, 2026Xiaoou Liu, Longchao Da, Hanyang Chen +2Agent ReliabilityGUI Agents

  5. Paying for Honesty Without Knowing the Truth: Reputation-Penalty Design for LLM Marketplace Agents

    Jul 30, 2026Mingdai Yang, Shicheng Fan, Kejing Yu +5Agent ReliabilityDeception in Language Models

  6. Engineering Trustworthy Agentic AI for Critical Systems

    Jul 20, 2026Omar Al-Refai, Ibrahim Shahbaz, Adam Ali Husseinat +3AI AssuranceAgent Reliability

  7. Teach it to stop, not just to click

    Jul 19, 2026Barada Sahu, Shivesh PandeyAI Agent ReliabilityAgent Reliability

  8. AI Agents Do Not Fail Alone:The Context Fails First

    Jul 15, 2026Fouad BousetouaneAI Agent ReliabilityAgent Reliability

  9. Beyond Global Replanning: Hierarchical Recovery for Cross-Device Agent Systems

    Jun 18, 2026Shu Yao, Yuhua Luo, Qian Long +7Hierarchical PlanningMulti-Agent Orchestration

  10. On the Reliability of Networks of AI Agents: Density Evolution, Stopping Sets, and Architecture Optimization

    Jun 16, 2026Ehsan Aghazadeh, Hossein Pishro-NikAgent ReliabilityMulti-Agent Systems

  11. RAILS: Verification-Native Clearing For Agentic Commerce

    Jun 7, 2026Adrian de Valois-Franklin, Alex BogdanAgent ReliabilityAgentic Commerce

  12. Monitoring Agentic Systems Before They're Reliable

    Jun 1, 2026Marisa Ferrara Boston, Glen Hanson, Effi Georgala +2Agent Failure AnalysisAgent Reliability

  13. ROGUE: Evaluating Corrigibility Failures in Frontier Computer-Use Agents

    May 29, 2026Jeremy Tien, Abishek Anand, Yu-Rou Tuan +3Agent ReliabilityComputer-Use Agents

  14. TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories

    May 29, 2026Junjie Nian, Kang Chen, Ge Zhang +2Agent ReliabilitySoftware Engineering Benchmarks

  15. DART: Semantic Recoverability for Structured Tool Agents

    May 22, 2026Ke Yang, Panpan Li, Zonghan Wu +3Agent ReliabilityRuntime Assurance

  16. Behavioral Integrity Verification for AI Agent Skills

    May 12, 2026Yuhao Wu, Tung-Ling Li, Hongliang LiuAgent ReliabilityAI Agent Auditing

  17. An Uncertainty-Aware Resilience Micro-Agent for Causal Observability in the Computing Continuum

    May 11, 2026Suvi De Silva, Alfreds Lapkovskis, Alaa Saleh +2Agent ReliabilityEdge Computing

  18. Consistency as a Testable Property: Statistical Methods to Evaluate AI Agent Reliability

    May 11, 2026Harsh Raj, Niranjan Orkat, Suvrorup Mukherjee +3AI Agent ReliabilityAgent Reliability

  19. Securing Computer-Use Agents: A Unified Architecture-Lifecycle Framework for Deployment-Grounded Reliability

    May 8, 2026Zejian Chen, Zhanyuan Liu, Chaozhuo Li +6Agent ReliabilityComputer-Use Agents

  20. Crab: A Semantics-Aware Checkpoint/Restore Runtime for Agent Sandboxes

    Apr 30, 2026Tianyuan Wu, Chaokun Chang, Lunxi Cao +2Agent ReliabilityLLM Agent Reliability

  21. On the Reliability of Computer Use Agents

    Apr 20, 2026Gonzalo Gonzalez-Pumariega, Saaket Agashe, Jiachen Yang +2AI Agent ReliabilityAgent Reliability

  22. Towards Shutdownable Agents: Generalizing Stochastic Choice in RL Agents and LLMs

    Apr 19, 2026Carissa Cullen, Harry Garland, Alexander Roman +3Agent ReliabilityAI Agent Safety

  23. Resilient by Design -- Active Inference for Distributed Continuum Intelligence

    Nov 10, 2025Praveen Kumar Donta, Alfreds Lapkovskis, Enzo Mingozzi +1Agent ReliabilityActive Inference

  24. Enabling Regulatory Multi-Agent Collaboration: Architecture, Challenges, and Solutions

    Sep 11, 2025Qinnan Hu, Yuntao Wang, Yuan Gao +3Agent ReliabilityAI Agent Security