LLM Agent Reliability

LLM: Large Language Model

Momentum

90 papers in the last four weeks, up 109% on the four weeks before. 0.9% of all new papers.

Jul 13Week of Sep 28

Latest papers 558

All topics
CardsList
  1. Can LLMs Fix It Without Code? Toward Automated Verification of No-Code Bug Fixes

    Oct 8, 2026Utku Boran Torun, Veli Karakaya, Eray TüzünAutomated EvaluationLLM Agent Reliability

  2. One Skill Too Many: How Co-Installed Skills Conflict in Coding Agents

    Oct 8, 2026Chaoliang Yan, Zihao Xu, Yuekang Li +4Coding AgentsLLM Agent Reliability

  3. Evaluating Local Language Model Agents for Reproducible Data Engineering: An Empirical Software Engineering Study of Mobility Workflows

    Oct 8, 2026Jorge García-Carrasco, Javier Sanchis, Alejandro Reina-Reina +2LLM Agent EvaluationLLM Agent Reliability

  4. ReCast: Attribution-Oriented Step Representation Learning for LLM-Based Agent Systems

    Oct 8, 2026Weilin Jin, Mingyu Wang, Taiyu Zhu +7Agent Failure AnalysisLLM Agent Reliability

  5. Cross-Provider Review as a Runtime Contract for Coding Agents: A Controlled Pilot and Fault-Injection Study

    Oct 7, 2026Bowen Xu, Boyu ChenCoding AgentsRuntime Enforcement for AI Agents

  6. Why Software Engineering Is Indispensable in the Age of Coding Agents

    Oct 7, 2026Alfonso FuggettaSoftware EngineeringAI-Assisted Software Development

  7. Loud Failures, Quiet Failures: Fault Detection and Recovery in Tool-Using Language Model Agents

    Oct 7, 2026Obada KraishanTool-Using AgentsLLM Agent Reliability

  8. The Confidence Game: Strategic Miscalibration in Human-AI Delegation

    Oct 7, 2026Raghu Arghal, Saswati Sarkar, Shirin Saeedi BidokhtiLLM Agent ReliabilityConfidence Estimation in Language Models

  9. Humanize: Judgement Engineering for Agentic Coding

    Oct 6, 2026Sihao Liu, Ligeng Zhu, Zijian Zhang +6Multi-Agent CodingLLM Agent Orchestration

  10. Confidence Reasoning Graphs: Structured Confidence Estimation for LLM Agents

    Oct 6, 2026Brendan King, Farima Fatahi Bayat, Jean-Flavien Bussotti +2Probability CalibrationConfidence Estimation in Language Models

  11. One Step at a Time: Trading LLM Autonomy for Process Predictability

    Oct 6, 2026Hans Schabert, Christoph PetersAI Agent AuditingBusiness Process Automation

  12. Do I Need the Cloud? Uncertainty-Aware Step-Level Handoff for Small Language Model Agents

    Oct 6, 2026Abolfazl YounesiSmall Language ModelsLLM Agents

  13. From Evidence to Action: How Tool-Using Agents Fail

    Oct 6, 2026Hongzhan Lin, Shidong Cao, Ziyang Luo +3Agent Failure AnalysisEvidence-Grounded Reasoning

  14. Selective Critique for Cost-Aware LLM Agents in Long-Horizon Decision Making

    Oct 5, 2026Heewon Park, Somin Im, Minhae KwonLong-Horizon LLM AgentsLLM Agent Reliability

  15. HERA: Harness-Environment Co-Evolution for Reliable Agentic Abstention

    Oct 5, 2026Han Luo, Bingbing Wen, Guang Yang +3Agent Harness OptimizationLLM Agent Reliability

  16. Judged Useless, Queried Anyway: Tool-Using Agents Rarely Turn Their Own Evidence Judgments into Stopping Decisions

    Oct 5, 2026Chubin Zhang, Zhenglin Wan, Xingrui Yu +4LLM Agent EvaluationTool-Using Agents

  17. Attention Tax, Handoff Tax: A Stylised Model of When Multi-Agent LLM Systems Help

    Oct 5, 2026Akshit Anchan, Nayonika SenMulti-Agent LLM SystemsMulti-Agent Reasoning

  18. Disentangling Task Difficulty from Run-Level Failure in Agent Failure Prediction

    Oct 4, 2026Mohsen EsfandyariDoulabi, Lawrence Arkoh, Biruk Tadesse +4Agent Failure AnalysisLLM Agent Evaluation

  19. When Agent Context Goes Stale: Incoherence in Volatile Agent Context

    Oct 4, 2026Yingying Liu, Junzhou Fang, Chenxiong QianLLM Context ManagementLLM Agent Reliability

  20. StateWise: Diagnosing and Repairing Persistent Operational State Before Agent Actions

    Oct 4, 2026Yongyuan Peng, Zhou Feng, Tongying Wu +5Agent Failure AnalysisSoftware Engineering Agents

  21. Harnessing LLMs as Agents: What Does It Cost?

    Oct 1, 2026Zelin Zhao, Xinyu Guo, Jingyuan Zhang +2LLM Agent HarnessesMemory-Augmented Language Model Agents

  22. Counting Moves, Weighing Voices: Bayesian Dialectical Argumentation for Calibrated Multi-LLM Councils under Persistent Adversaries

    Oct 1, 2026Ionel Eduard Stan, Paolo NapoletanoLanguage Model CalibrationComputational Argumentation