LLM Agent Reliability

LLM: Large Language Model

Momentum

90 papers in the last four weeks, up 109% on the four weeks before. 0.9% of all new papers.

Jul 13Week of Sep 28

Latest papers 558

All topics
CardsList
  1. Designing Agent-Ready Websites for AI Web Agents: A Framework for Machine Readability, Actionability, and Decision Reliability

    Jul 13, 2026Said Elnaffar, Farzad RashidiE-CommerceWeb Agents

  2. Agentic systems for breast cancer treatment recommendations

    Jul 13, 2026Vinicius Anjos de Almeida, Nícolas Henrique Borges, Leonardo Vicenzi +5Multi-Agent LLM SystemsClinical Decision Support

  3. Inference Economics of Enterprise Coding Agents: A Case Study of Cloud vs. On-Premise LLMs

    Jul 13, 2026Sheng-Wei Peng, Yi-Hsun Lin, Yi-Pei LeeLLM ServingSoftware Engineering Agents

  4. AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP

    Jul 13, 2026Aritra Mazumder, Nusrat jahan LiaAI Agent ReliabilityLLM Agent Evaluation

  5. Distributed Agent System: Fault-Tolerant Collaboration Among Embodied Agents

    Jul 12, 2026Kai Yu, Lu Chen, Hanqi LiMulti-Agent CollaborationMulti-Agent Systems

  6. AgentAbstain: Do LLM Agents Know When Not to Act?

    Jul 11, 2026Xun Liu, Yi Evie Zhang, Vira Kasprova +5AI Agent ReliabilityLLM Agent Evaluation

  7. Failure as a Process: An Anatomy of CLI Coding Agent Trajectories

    Jul 10, 2026Xiangxin Zhao, Han Li, Shuaiting Li +4Agent Failure AnalysisCoding Agents

  8. Scoped Verification for Reliable Long-Horizon Agentic Context Evolution under Distribution Shift

    Jul 10, 2026Dan C. Hsu, Luke LuAI Agent ReliabilityLong-Horizon Agent Evaluation

  9. Eluna: An Agentic LLM System for Automating Warehouse Operations with Reasoning and Task Execution

    Jul 9, 2026Ning Liu, Kalle Kujanpää, Zhaoxuan Zhu +11Multi-Agent LLM SystemsLLM Agent Orchestration

  10. Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems

    Jul 9, 2026Kalle Kujanpää, Ning Liu, Shahnawaz Alam +4LLM Inference EfficiencyLLM Agent Self-Improvement

  11. Agent Delivery Engineering Predictive Reliability Framework

    Jul 8, 2026Dexing LiuAI Agent ReliabilityMulti-Agent LLM Systems

  12. Reason Less, Verify More: Deterministic Gates Recover a Silent Policy-Violation Failure Mode in Tool-Using LLM Agents

    Jul 8, 2026Vikas Reddy, Sumanth Reddy Challaram, Abhishek BasuAgent Failure AnalysisAI Agent Reliability

  13. Reliable and Developer-Aligned Evaluation of Agents for Software Engineering

    Jul 7, 2026Razvan Mihai PopescuSoftware Engineering AgentsLLM Agent Evaluation

  14. Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade

    Jul 7, 2026Kai Ruan, Zihe Huang, Ziqi Zhou +4LLM Inference EfficiencyEarly Stopping

  15. PatchOptic for Shared-State LLM Workflows with Projected Views and Verified Structured Updates

    Jul 6, 2026Zhaoyu Bai, Jiaqi CaiAgentic WorkflowsLLM Context Management

  16. AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments

    Jul 6, 2026Zhiheng Xi, Dingwen Yang, Jiaqi Liu +22LLM Agent EvaluationAI Agent Benchmarks

  17. When Agents Lie: Premeditation, Persistence, and Exploitation in Repeated Games

    Jul 6, 2026Jerick Shi, Terry Jingcheng Zhang, Bernhard Schölkopf +2Multi-Agent LLM SystemsGame-Playing Agents

  18. Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning

    Jul 5, 2026Haiwen Yi, Xinyuan SongOffline RLLLM Agent Harnesses

  19. The "I Don't Know" Filter: Enhancing Agentic Reliability in Function Calling

    Jul 4, 2026Stefan Broecker, Mason del Rosario, Boris Selitser +1AI Agent ReliabilityLLM Agent Evaluation

  20. Swarm-Driven Multi-Agent Reasoning for Smart City Security

    Jul 3, 2026Saeid Jamshidi, Kawser Wazed Nafi, Carol Fung +1Multi-Agent LLM SystemsCybersecurity

  21. Evaluating Generative Agents with Actions Grounded in Socially Distributed Task Environments using Incognita

    Jul 3, 2026Dan C. Hsu, Luke LuLLM Agent EvaluationAI Agent Benchmarks