LLM Agent Reliability

LLM: Large Language Model

Momentum

90 papers in the last four weeks, up 109% on the four weeks before. 0.9% of all new papers.

Jul 13Week of Sep 28

Latest papers 558

All topics
CardsList
  1. One Readout, Many Repairs: Diffusion-Guided Hierarchical Search for Tool-Agent Repair

    Sep 28, 2026Xiang Xia, Cheng Yan, Wuyang Zhang +4LLM Agent Reliability

  2. SGG-ReflAct: Sub-Goal Guided ReflAct with Structured Planning for Reliable Long-Horizon Reasoning

    Sep 28, 2026Jaeho Jung, Sung Hoon JungLLM AgentsLong-Horizon LLM Agents

  3. The Marathon of Scientific Reasoning: Robustness of Scientific Agents to Perturbations in Multi-Turn Interactions

    Sep 28, 2026Xiaoting Lyu, Xinbo Ma, Yufei Han +5AI Agent BenchmarksScientific Reasoning in Language Models

  4. Commitment Hierarchies under Intent Revision: A Belief-Revision Account of Salvage in Tool-Use Agents

    Sep 28, 2026Spandan Ghose ChowdhuryBelief RevisionLLM Planning

  5. ControlScope: Workflow Revision and Reliability in LLM Agents

    Sep 28, 2026Jingjie Ning, Xueqi Li, Yibo Kong +1LLM Agent EvaluationLLM Agent Reliability

  6. Same Winners, Different Success Rates: Evaluating How LLM Agents Recover from Failures

    Sep 28, 2026Dong Xu, Zhangfan Yang, Jiantao Wu +5LLM Agent EvaluationAI Agent Benchmarks

  7. StateGuard: Analytical-State Management with Validity-Aware Intervention for Long-Horizon Data Agents

    Sep 28, 2026Wenle Liao, Zhao Wang, Jingchao Zhang +3LLM Agent VerificationGraph-Based Agent Memory

  8. Prospective Interpretation Risk: Principled Communication Control Between LLMs

    Sep 27, 2026Wanrong Yang, Rehan Deen, Julian Ma +7Multi-Agent LLM SystemsPragmatic Reasoning in Language Models

  9. Identical Runs, Different Results: Benchmarking AI Coding Agents on Open-Weight Models

    Sep 27, 2026Eduardo Ariño de la Rubia, Szilard PafkaAI Coding AgentsLLM Agent Evaluation

  10. HESP: Separating What to Probe from When to Stop in Local LLM Alert-Triage Agents

    Sep 27, 2026Zhuowen Liu, Zhixuan WangLLMs for CybersecurityLLM Agent Reliability

  11. TraceDance: An Automated System for Building Agent Behavior Benchmarks from Real-World Agent Deployment Traces

    Sep 27, 2026Dehai Min, Daoan Zhang, Yiming Zeng +13Benchmark ConstructionLLM Agent Evaluation

  12. LLM Parkinsonism: Executive-Control Failure, Token-Inefficient Persistence, and an Uncertainty-Aware Global Executive Control Architecture for Autonomous Language-Model Agents

    Sep 25, 2026Dongsheng Xiao, Zeyuan Wang, Xuzhe Xia +2Overthinking in Language ModelsLLM Agents

  13. IndicBankBench: Evaluating Safety and Reliability of Language Model Assistants in Indian Retail Banking

    Sep 24, 2026Suvradip Paul, Chandra Bhushan, Harsh Sharma +4LLM Safety BenchmarksFinancial Services

  14. MeshHeal: Two-Timescale Self-Healing for Gray Failures in Decentralized LLM Agent Networks

    Sep 24, 2026Keru Chen, Sen Lin, Yingbin Liang +2Multi-Agent LLM SystemsMulti-Agent Systems

  15. Driving Epidemic Models with AI Agents: the Epydemix Agent Framework

    Sep 23, 2026Nicolò Gozzi, Ciro Cattuto, Alessandro VespignaniAI Agents for Scientific DiscoveryLLM Agent Harnesses

  16. Learning from Failures: Heterogeneous Graph Memory for Small Language Model Tool-Using Agents

    Sep 23, 2026Jiaxing Li, Lei Song, Rui Dong +1Graph-Based Agent MemoryLong-Horizon LLM Agents

  17. Where Cyber Agents Struggle: Bottleneck Analysis of Multi-Stage LLM Agents

    Sep 23, 2026Saeedeh Lohrasbi, Mohammad Mamun, Ahmed Yehia +2Agent Failure AnalysisLLM Agent Evaluation

  18. REFLEX with Jev for Efficient Selective Control in LLM Agents

    Sep 22, 2026Tiantong Wu, Wei Yang Bryan LimLLM Inference EfficiencyLLM Agent Evaluation