AI Agent Reliability

Momentum

34 papers in the last four weeks, up 240% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 215

All topics
CardsList
  1. Finishing the Task Is Not Enough: Evaluating Agent Resilience and Considerate Participation under Accumulating Challenge

    Sep 12, 2026Yuanchen Bai, Zijian Ding, Angelique TaylorAI Agent ReliabilityAgent Reliability

  2. Agent-Integrated Software: Interaction Contracts and Continuous Assurance

    Sep 12, 2026Shengcheng Yu, Chunrong Fang, Zhenyu ChenAI Agent ReliabilityHuman-AI Interaction

  3. Vision: Data-Centric Anchoring for Robust and Interpretable Agentic AI

    Sep 8, 2026Arun Vignesh Malarkkan, Xinyuan Wang, Yanjie FuAI Agent ReliabilityDistribution Shift

  4. CIVI: A Framework for Diagnosing Search Agent Failures in Civic Information

    Sep 8, 2026Dingying Liu, Yunshun Zhong, Wentao Zhang +1Agent Failure AnalysisAI Agent Reliability

  5. Remember and Reweight: Enhancing Multi-Agent Debate with Experience Memory and Confidence Estimation

    Sep 3, 2026Xuanfa Jin, Zhijian Ma, Yongcheng Zeng +3AI Agent ReliabilityMulti-Agent Debate

  6. Forward-Deployed Full-Stack Engineering for Autonomous Cloud MLOps

    Aug 30, 2026Sagar Srinivas Sakhinana, Venkataramana RunkanaSoftware Engineering AgentsMulti-Agent Orchestration

  7. Robustness Analysis of Agentic AI to Inconsistent and Incomplete Tool Responses

    Aug 24, 2026Jiachen Xu, Torben Bach Pedersen, Zhongming Yao +2Agent Failure AnalysisAI Agent Reliability

  8. Agent Behavioral Contracts II: Certifying Compositional Reliability Without Assuming Independence

    Aug 13, 2026Varun Pratap Bhardwaj, Garima Singh, Arun Pratap BhardwajAgent Failure AnalysisAI Agent Reliability

  9. Software Engineering for and with GUI Agent

    Aug 10, 2026Shengcheng Yu, Yuchen Ling, Junyang Xing +3AI Agent ReliabilityGUI Agents

  10. CyberAGENTS: Structured Autonomy for Agentic Gamified Learning in Cybersecurity

    Aug 8, 2026Ivan Hornung, Deepthi Marasinghe Arachchige, Tharindu Kumarage +4AI Agent ReliabilityEducational Technology

  11. SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents

    Aug 5, 2026Zhixiang Liang, Yifei Liu, Yidan Huang +5Agent Failure AnalysisAI Agent Reliability

  12. SafeCommit: Certifying When Memory-Grounded Agents May Safely Act

    Aug 4, 2026Mayur Akewar, Ravi RanjanAgent MemoryAI Agent Reliability

  13. Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems

    Aug 4, 2026Sebastián Andrés Cajas Ordóñez, Agastya Munnangi, Aldo Marzullo +13AI Agent ReliabilityMulti-Agent LLM Systems

  14. PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise

    Aug 3, 2026Abdulrahman AlRabah, Xiaocheng Yang, Dilek Hakkani-Tür +1AI Agent ReliabilityAI-Assisted Decision Making

  15. Control Under Compression: Reliability Frontiers for Tool-Using Agents

    Aug 2, 2026Yinghan Hou, Zongyou YangAI Agent ReliabilityAI Agent Benchmarks

  16. DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning

    Aug 1, 2026An Lanji, Dawei Liu, Jin Li +3AI Agent ReliabilityVLM Interpretability

  17. Measuring Cross-Task Behavioral Consistency in Language Model Agents

    Jul 31, 2026Amritesh Banerjee, Pranil RaichuraAI Agent ReliabilitySoftware Engineering Agents