AI Agent Reliability

Momentum

34 papers in the last four weeks, up 240% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 215

All topics
CardsList
  1. AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators

    May 9, 2026Aritra Mazumder, Shubhashis Roy Dipta, Nusrat Jahan Lia +10AI Agent ReliabilityMulti-Agent Collaboration

  2. Tool Calling is Linearly Readable and Steerable in Language Models

    May 8, 2026Zekun Wu, Ze Wang, Seonglae Cho +4AI Agent ReliabilityTool-Augmented Language Model Agents

  3. Conformal Agent Error Attribution

    May 7, 2026Naihe Feng, Yi Sui, Shiyi Hou +2Agent Failure AnalysisAI Agent Reliability

  4. MANTRA: Synthesizing SMT-Validated Compliance Benchmarks for Tool-Using LLM Agents

    May 7, 2026Ashwani Anand, Ivi Chatzi, Ritam Raha +1Computer-Use Agent BenchmarksAI Agent Reliability

  5. Robust Agent Compensation (RAC): Teaching AI Agents to Compensate

    May 5, 2026Srinath Perera, Kaviru Hapuarachchi, Frank Leymann +1AI Agent ReliabilityLLM Agent Reliability

  6. ARIS: Autonomous Research via Adversarial Multi-Agent Collaboration

    May 4, 2026Ruofeng Yang, Yongcan Li, Shuai LiAI Agent ReliabilityMulti-Agent LLM Systems

  7. When Alignment Isn't Enough: Response-Path Attacks on LLM Agents

    May 4, 2026Mingyu Luo, Zihan Zhang, Zesen Liu +7AI Agent ReliabilityLLM Agent Security

  8. Reliable AI Needs to Externalize Implicit Knowledge: A Human-AI Collaboration Perspective

    May 3, 2026Hengyu Liu, Tianyi Li, Zhihong Cui +5AI Agent ReliabilityHuman-in-the-Loop AI

  9. NeuroState-Bench: A Human-Calibrated Benchmark for Commitment Integrity in LLM Agent Profiles

    May 3, 2026Xiao JiaAI Agent ReliabilityLLM Agent Evaluation

  10. rAIson: Developing Reliable Decision-Making Agents

    May 2, 2026Pavlos Moraitis, Nikolaos Spanoudakis, Antonis KakasAI Agent ReliabilityExplainable Artificial Intelligence

  11. TRUST: A Framework for Decentralized AI Service v.0.1

    Apr 29, 2026Yu-Chao Huang, Zhen Tan, Mohan Zhang +3AI Agent ReliabilityAI Accountability

  12. Operating-Layer Controls for Onchain Language-Model Agents Under Real Capital

    Apr 28, 2026T. J. Barton, Chris Constantakis, Patti Hauseman +4AI Agent ReliabilityLLM Agent Evaluation

  13. FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments

    Apr 28, 2026Amir Saeidi, Venkatesh Mishra, Souradeep Mukhopadhyay +4AI Agent ReliabilityMulti-Agent LLM Systems

  14. GSAR: Typed Grounding for Hallucination Detection and Recovery in Multi-Agent LLMs

    Apr 25, 2026Federico A. KamelharAI Agent ReliabilityMulti-Agent LLM Systems

  15. Reliable Self-Harm Risk Screening via Adaptive Multi-Agent LLM Systems

    Apr 24, 2026Meghana Karnam, Ananya JoshiAI Agent ReliabilityMulti-Agent LLM Systems

  16. AI scientists produce results without reasoning scientifically

    Apr 20, 2026Martiño Ríos-García, Nawaf Alampara, Chandan Gupta +5AI Agent ReliabilityScientific Reasoning

  17. On the Reliability of Computer Use Agents

    Apr 20, 2026Gonzalo Gonzalez-Pumariega, Saaket Agashe, Jiachen Yang +2AI Agent ReliabilityAgent Reliability

  18. SeekerGym: A Benchmark for Reliable Information Seeking

    Apr 18, 2026Remy Kim, Minseung Lee, Shuo Li +1AI Agent ReliabilityAgentic Search

  19. Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents

    Apr 1, 2026Alibek Kaliyev, Artem MaryanskyyAI Agent ReliabilityTool-Use Evaluation

  20. MOOSEnger: A Simulation-Aware AI Agent Framework for the MOOSE Ecosystem

    Mar 5, 2026Mengnan Li, Jason Miller, Zaid Abulawi +7AI Agent ReliabilityAgentic Code Generation

  21. When Is Enough Not Enough? Illusory Completion in Search Agents

    Feb 7, 2026Dayoon Ko, Jihyuk Kim, Sohyeon Kim +5AI Agent ReliabilityLLM Answer Verification

  22. AgentRx: Diagnosing AI Agent Failures from Execution Trajectories

    Feb 2, 2026Shraddha Barke, Arnav Goyal, Alind Khare +3Agent Failure AnalysisAI Agent Reliability