LLM Agent Reliability

LLM: Large Language Model

Momentum

90 papers in the last four weeks, up 109% on the four weeks before. 0.9% of all new papers.

Jul 13Week of Sep 28

Latest papers 558

All topics
CardsList
  1. Engineering Robustness into Personal Agents with the AI Workflow Store

    May 11, 2026Roxana Geambasu, Mariana Raykova, Pierre Tholoniat +3Agentic WorkflowsLLM Agent Security

  2. ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox

    May 11, 2026Yuanyang Li, Xue Yang, Longyue Wang +2LLM Agent EvaluationAI Agent Benchmarks

  3. The Agent Use of Agent Beings: Agent Cybernetics Is the Missing Science of Foundation Agents

    May 11, 2026Xinrun Wang, Chang Yang, He Zhao +2Self-Improving AgentsLong-Horizon LLM Agents

  4. The Trap of Trajectory: Towards Understanding and Mitigating Spurious Correlations in Agentic Memory

    May 10, 2026Luoxi Tang, Rupali Rajendra Vaje, Yuqiao Meng +5AI Agent BenchmarksLLM Agent Reliability

  5. A Prompt-Aware Structuring Framework for Reliable Reuse of AI-Generated Content in the Agentic Web

    May 10, 2026Shusaku Egami, Masahiro HamasakiAI Agent SafetyLLM Agent Reliability

  6. Trustworthy AI: Ensuring Reliability and Accountability from Models to Agents

    May 9, 2026Carol Xuan LongMulti-Agent LLM SystemsAI Accountability

  7. Debugging the Debuggers: Failure-Anchored Structured Recovery for Software Engineering Agents

    May 9, 2026Chenyu Zhao, Shenglin Zhang, Yihang Lin +7Agent Failure AnalysisSoftware Engineering Agents

  8. AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators

    May 9, 2026Aritra Mazumder, Shubhashis Roy Dipta, Nusrat Jahan Lia +10AI Agent ReliabilityMulti-Agent Collaboration

  9. Why Retrying Fails: Context Contamination in LLM Agent Pipelines

    May 8, 2026Zhanfu YangLLM Context ManagementLLM Agent Reliability

  10. Business Utility of Large Language Models as Exploratory Data Analysis Agents

    May 8, 2026Rafał Łabędzki, Patryk Miziuła, Hubert Rutkowski +5LLM Agent EvaluationAI Agent Benchmarks

  11. Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning

    May 8, 2026Yuyang Wu, Yue Huang, Shuaike Shen +8AI Agents for Scientific DiscoveryLLM Agent Evaluation

  12. EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation

    May 8, 2026Yi Liu, TingFeng Hui, Wei Zhang +4AI Agent EvaluationAI Agent Benchmarks

  13. MedExAgent: Training LLM Agents to Ask, Examine, and Diagnose in Noisy Clinical Environments

    May 8, 2026Yicheng Gao, Xiaolin Zhou, Yahan Li +2HealthcareMedical Diagnosis

  14. PrefixGuard: Online Failure Warning and Trace-Grounded Diagnosis for LLM Agents

    May 7, 2026Xinmiao Huang, Jinwei Hu, Qisong He +4Fault DetectionAI Agent Monitoring

  15. A Self-Healing Framework for Reliable LLM-Based Autonomous Agents

    May 7, 2026Cheonsu Jeong, Younggun ShinSoftware Engineering AgentsFault Detection

  16. TACT: Mitigating Overthinking and Overacting in Coding Agents via Activation Steering

    May 7, 2026Yuan Sui, Yulin Chen, Yibo Li +6AI Coding AgentsLong-Horizon LLM Agents

  17. Say the Mission, Execute the Swarm: Agent-Enhanced LLM Reasoning in the Web-of-Drones

    May 5, 2026Andrea Iannoli, Lorenzo Gigli, Luca Sciullo +2Aerial RoboticsMulti-Robot Systems

  18. Robust Agent Compensation (RAC): Teaching AI Agents to Compensate

    May 5, 2026Srinath Perera, Kaviru Hapuarachchi, Frank Leymann +1AI Agent ReliabilityLLM Agent Reliability

  19. What Happens Inside Agent Memory? Circuit Analysis from Emergence to Diagnosis

    May 5, 2026Xutao Mao, Jinman Zhao, Gerald Penn +1Agent MemoryMechanistic Interpretability

  20. ARIS: Autonomous Research via Adversarial Multi-Agent Collaboration

    May 4, 2026Ruofeng Yang, Yongcan Li, Shuai LiAI Agent ReliabilityMulti-Agent LLM Systems

  21. Foundation-Model-Based Agents in Industrial Automation: Purposes, Capabilities, and Open Challenges

    May 4, 2026Vincent Henkel, Felix Gehlhoff, David Kube +13AI Agent EvaluationLLM Agent Reliability