LLM Agent Reliability

LLM: Large Language Model

Momentum

90 papers in the last four weeks, up 109% on the four weeks before. 0.9% of all new papers.

Jul 13Week of Sep 28

Latest papers 558

All topics
CardsList
  1. Deep Agentic Search for Repository-Level Code Question Answering: An Empirical Study

    Aug 2, 2026Amirkia Rafiei Oskooei, Bora Ilci, Alperen Kayim +5Agentic SearchSemantic Search

  2. HopRefusalBench: Diagnosing Refusal Failures in Search-Augmented Agents for Multi-Hop Reasoning

    Aug 2, 2026Jianan Xie, Xin Sun, Zhongqi Chen +3Multi-Hop QAAI Agent Benchmarks

  3. Control Under Compression: Reliability Frontiers for Tool-Using Agents

    Aug 2, 2026Yinghan Hou, Zongyou YangAI Agent ReliabilityAI Agent Benchmarks

  4. Measuring Cross-Task Behavioral Consistency in Language Model Agents

    Jul 31, 2026Amritesh Banerjee, Pranil RaichuraAI Agent ReliabilitySoftware Engineering Agents

  5. AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?

    Jul 31, 2026Dong Yan, Jian Liang, Dapeng Hu +4LLM Agent EvaluationAI Agent Benchmarks

  6. Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures

    Jul 31, 2026Isham Kalappurackal Mansoor, Abhishek Phadke, Pratip RanaAI Agent ReliabilityLLM Tool Use

  7. Validation Evidence in LLM Repair Agents: How Much of What Passes Actually Tests the Bug?

    Jul 30, 2026Xiaonan Xu, Wenjing WuAutomated Software TestingAutomated Program Repair

  8. ORCA-bench: How Ready Are Language Model Agents for Oncall?

    Jul 30, 2026Albert Gong, Kyuseong Choi, Abhineet Agarwal +5Software Engineering AgentsAI Agent Benchmarks

  9. One Human, NN Agents: Audit-Budget Allocation for LLM Agent Fleets under Miscalibrated, Correlated Confidence

    Jul 30, 2026Cesare Zavattari, Alessandro Tommasi, Giuseppe PrencipeScalable OversightAI Agent Reliability

  10. Vibe-FDTR: An agent-oriented framework for reproducible frequency-domain thermoreflectance data analysis

    Jul 30, 2026Fuwei Yang, Weiheng Li, Bai SongLLM Agent Reliability

  11. ΣΣ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems

    Jul 30, 2026Peilin Feng, Suorong Yang, Soujanya PoriaAI Agent ReliabilityMulti-Agent LLM Systems

  12. Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems

    Jul 29, 2026Xu Zheng, Zhuomin Chen, Chaohao Lin +4Long-Horizon Agent TasksLong-Horizon LLM Agents

  13. Can AI agents conduct open-ended AI research? Early evidence from two case studies

    Jul 29, 2026Peter Kirgis, Sayash Kapoor, Andrew Schwartz +21AI-Assisted Scientific ResearchAI Agent Evaluation

  14. Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

    Jul 29, 2026Amirmohammad Farzaneh, Osvaldo SimeoneLLM Inference EfficiencyAI Agent Reliability

  15. Flat Score, Amplified Failures: How the Error Budget Masks Damage in Quantized LLM Agents

    Jul 29, 2026Jiwon Jang, Kisu Yang, Heuiseok Lim +1AI Agent ReliabilityBenchmark Design

  16. Falsifiable Commitment Planning for Self-Correcting Web Agents

    Jul 27, 2026Guangyi Liu, Huan Zhao, Quanming YaoLong-Horizon LLM AgentsWeb Agents