AI Agent Reliability

Momentum

34 papers in the last four weeks, up 240% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 215

All topics
CardsList
  1. ToolChain-CRC: Conformal Risk Control for Agentic AI Under Retrieval and Tool-Use Drift

    Jun 16, 2026Jeffery Opoku, David BanaheneAI Agent ReliabilityDistribution Shift

  2. LLM-as-Code: Agentic Programming for Agent Harness

    Jun 14, 2026Junjia Qi, Zichuan Fu, Jingtong Gao +4AI Agent ReliabilityLLM Agent Orchestration

  3. ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents

    Jun 13, 2026Rahul Suresh Babu, Laxmipriya Ganesh IyerAI Agent ReliabilityTool-Use Evaluation

  4. RogueAI: A Reverse Turing Test for Detecting Licensed AI Deception in Dialogue

    Jun 11, 2026Sara Candussio, Emanuele Ballarin, Lorenzo Bonin +2AI Agent ReliabilityLanguage Model Safety Evaluation

  5. SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents

    Jun 11, 2026Ziyi Wang, Yuxuan Lu, Yimeng Zhang +8AI Agent ReliabilityReinforcement Learning

  6. (Human) Attention Is (Still) All You Need: Human oversight makes AI-assisted social science reliable

    Jun 11, 2026Chen Zhu, Xiaolu Wang, Weilong ZhangAI Agent ReliabilityAI-Assisted Scientific Research

  7. Strategic Decision Support for AI Agents

    Jun 10, 2026Shayan Kiyani, Sima Noorani, George Pappas +1AI Agent ReliabilityTool-Using Agents

  8. AI Coding Agents in Social Science: Methodologically Diverse, Empirically Consistent, Interpretively Vulnerable

    Jun 9, 2026Meysam Alizadeh, Fabrizio Gilardi, Mohsen Mosleh +1AI Agent ReliabilityAI Coding Agents

  9. ττ-Rec: A Verifiable Benchmark for Agentic Recommender Systems

    Jun 8, 2026Bharath Sivaram Narasimhan, Karthik R NarasimhanAI Agent ReliabilityAI Agent Benchmarks

  10. SKILL.nb: Selective Formalization and Gated Execution for Durable Agent Workflows

    Jun 6, 2026Amine El Hattami, Nicolas Chapados, Christopher PalAI Agent ReliabilityAgentic Workflows

  11. Contract2Tool: Learning Preconditions and Effects for Reliable Tool-Augmented LLM Agents

    Jun 5, 2026Rahul Suresh Babu, Laxmipriya Ganesh IyerAI Agent ReliabilityTool-Use Evaluation

  12. ToolChoiceConfusion: Causal Minimal Tool Filtering for Reliable LLM Agents

    Jun 4, 2026Rahul Suresh Babu, Laxmipriya Ganesh IyerAI Agent ReliabilityTool-Use Evaluation

  13. When Tools Fail: Benchmarking Dynamic Replanning and Anomaly Recovery in LLM Agents

    Jun 4, 2026Dongsheng Zhu, Xuchen Ma, Yucheng Shen +5AI Agent ReliabilityAI Agent Benchmarks

  14. From Agent Traces to Trust: A Survey of Evidence Tracing and Execution Provenance in LLM Agents

    Jun 3, 2026Yiqi Wang, Jiaqi Zhang, Taotao Cai +8AI Agent ReliabilityData Provenance

  15. AIP: A Graph Representation for Learning and Governing Agent Skills

    Jun 3, 2026Zachary Blumenfeld, Jim WebberAI Agent ReliabilityAgent Skill Learning

  16. POIROT: Interrogating Agents for Failure Detection in Multi-Agent Systems

    Jun 1, 2026Iñaki Dellibarda Varela, R. Sendra-Arranz, Pablo Romero-Sorozabal +5Agent Failure AnalysisAI Agent Reliability

  17. Counterfactual Graph for Multi-Agent LLM Calibration

    May 28, 2026Jiatan Huang, Mingchen Li, Ziming Li +3AI Agent ReliabilityLanguage Model Calibration

  18. Honest Lying: Understanding Memory Confabulation in Reflexive Agents

    May 28, 2026Prakhar Dixit, Sadia Kamal, Tim OatesAI Agent ReliabilityLLM Self-Refinement

  19. PatchBoard: Schema-Grounded State Mutation for Reliable and Auditable LLM Multi-Agent Collaboration

    May 28, 2026Shuyu Zhang, Yaqi Shi, Jiarui Zhang +2AI Agent ReliabilityMulti-Agent LLM Systems

  20. Hallucination Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

    May 27, 2026Diego Gosmar, Deborah A. DahlAI Agent ReliabilityMulti-Agent LLM Systems