LLM Agent Reliability

LLM: Large Language Model

Momentum

90 papers in the last four weeks, up 109% on the four weeks before. 0.9% of all new papers.

Jul 13Week of Sep 28

Latest papers 558

All topics
CardsList
  1. Diagnosing with Insights: Structured Analysis of Agent Failures via Behavioral Abstractions

    Sep 2, 2026Jiayi Bi, Yanjie Gao, Yuanmin Xie +4Fault LocalizationLLM Agent Reliability

  2. Agents That Model Agents: Five Principles Toward a Theory of Mind for 6G Networks

    Sep 1, 2026Hatim Chergui, Carolina Fernández-Martínez, Mehdi Bennis +16G NetworksTheory of Mind

  3. HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution

    Sep 1, 2026Wen Jiang, Mingmin Chu, Yimeng Tian +6Agent Harness OptimizationLLM Agent Reliability

  4. Polished but Unresolved: Identifying Late-Stage Pressure States in Long-Horizon Tool-Use Agents

    Sep 1, 2026Haoyang Chen, Yi Liu, Jianzhi Shao +3LLM AgentsLong-Horizon LLM Agents

  5. Are We There Yet? Assessing Computer-Use Agents for Blind Users' Accessible Interaction with Desktop Applications

    Sep 1, 2026Satwik Ram Kodandaram, Monalika Padma Reddy, Xiaojun Bi +3Computer-Use AgentsHuman-AI Interaction

  6. Invalidation Contracts for Cross-Episode Agent Memory

    Aug 31, 2026Michael Wu, Arquimedes CanedoLLM Agent MemoryAgent Memory Management

  7. Lazy Grounding: Attacking Search Agents with Factual Evidence

    Aug 31, 2026Yulin Zhang, Yukun Huang, Sanxing Chen +4Evidence-Grounded ReasoningRAG Poisoning Attacks

  8. CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents

    Aug 31, 2026Amir Saeidi, Zehua Zhang, Rishitosh Singh +6LLM AgentsLLM Agent Training

  9. Source-Dependent Deference in Medical Imaging Agents Under Falsified Findings: A Pilot Audit

    Aug 30, 2026Ridam Roy, Md Shahriar Rashid, Md. Rajib MiaTool-Use EvaluationMedical VQA

  10. Detect Before You Attribute: Cascade Failure Attribution for Multi-Agent Systems

    Aug 30, 2026Jiayi Zhang, Zexin Wang, Degang Sun +4Agent Failure AnalysisMulti-Agent LLM Systems

  11. Logos: An Agent Harness on a Cross-Process Bus

    Aug 28, 2026Hanzhang Jia, Liheng Zeng, Hao Cheng +2Multi-Agent SystemsLLM Agent Harnesses

  12. Candidate supply and answer selection shape the value of LLM judging in multi-agent systems

    Aug 26, 2026Jia-Hao Ji, Sijie Li, Jiabei Cheng +3LLM-as-a-JudgeMulti-Agent Reasoning

  13. TRACE: A Self-Evolving Skill Bank for Consistent, Limit-Aware LLM Agents

    Aug 24, 2026Wenhao Wu, Menghao Zhang, Xin Wang +3Tool-Augmented Language Model AgentsLLM Agent Orchestration

  14. Robustness Analysis of Agentic AI to Inconsistent and Incomplete Tool Responses

    Aug 24, 2026Jiachen Xu, Torben Bach Pedersen, Zhongming Yao +2Agent Failure AnalysisAI Agent Reliability

  15. K-Bench: measuring model performance on real scientific agent requests

    Aug 21, 2026Aubrey M. Brueckner, Darshil Patel, Yuhuan He +1AI for ScienceLLM Agent Evaluation

  16. Don't Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents

    Aug 21, 2026Yanze Jiang, Mingxuan Li, Yuhao Wang +2LLM AgentsLLM Agent Reliability

  17. SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?

    Aug 20, 2026Zhipeng Xu, Jiahao Lu, Yining Zheng +2Software EngineeringAutomated Program Repair

  18. One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

    Aug 20, 2026Zhuochun Li, Youngmin Ko, Ali Keramati +11Business Process AutomationAI Agent Benchmarks

  19. AeroCopilotBench: Safety-Gated Evaluation of LLM Agents on Aircraft Emergency Procedures in an Executable Cockpit

    Aug 17, 2026Yuchen Yuan, Zhenghuang Wu, Yuangan Li +2LLM Safety BenchmarksAI Agent Safety Benchmarks

  20. QuoteBench: How Matched Scores Can Hide Command-Path Failures

    Aug 13, 2026Shangao Li, Yao Zhang, Volker Tresp +1LLM Agent EvaluationAgent Evaluation

  21. Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents

    Aug 12, 2026Junliang Liu, Ruoyu Li, Wenxin Tang +4Adversarial Attacks on LLMsLLM Agent Security

  22. Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents

    Aug 12, 2026Gen Dong, Yanjie Gao, Liqun Li +3LLM Agent EvaluationLLM Agent Reliability