LLM Agent Reliability

LLM: Large Language Model

Momentum

90 papers in the last four weeks, up 109% on the four weeks before. 0.9% of all new papers.

Jul 13Week of Sep 28

Latest papers 558

All topics
CardsList
  1. Knowledge-Based Zero-Replay Debugging of Multi-Agent LLM Traces

    Jun 11, 2026Dong Ho Kang, Hyeonjeong Cha, Daein WeonMulti-Agent LLM SystemsCounterfactual Prediction

  2. EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery

    Jun 11, 2026Amy Xin, Jiening Siow, Junjie Wang +5Autonomous Scientific DiscoveryAutonomous Research Agents

  3. Confidence Composition for Multiagent Language Model Systems

    Jun 11, 2026Ali Elahi, Michael J. Curry, Barbara Di EugenioMulti-Agent LLM SystemsProbability Calibration

  4. Understanding the Rejection of Fixes Generated by Agentic Pull Requests -- Insights from the AIDev Dataset

    Jun 11, 2026Mahmoud Abujadallah, Ali Arabat, Mohammed SayaghAgentic Code GenerationHuman-AI Collaboration

  5. LLM-as-an-Investigator: Evidence-First Reasoning for Robust Interactive Problem Diagnosis

    Jun 11, 2026Fabrizio Marozzo, Pietro LiòLLM SycophancyLLM Agent Evaluation

  6. (Human) Attention Is (Still) All You Need: Human oversight makes AI-assisted social science reliable

    Jun 11, 2026Chen Zhu, Xiaolu Wang, Weilong ZhangAI Agent ReliabilityAI-Assisted Scientific Research

  7. XFlow: An Executable Protocol Programming System for Reliable Multi-Agent Workflows

    Jun 11, 2026Hanqi Li, Jing Peng, Zijian Wang +2Multi-Agent OrchestrationAgentic Workflows

  8. Evoflux: Inference-Time Evolution of Executable Tool Workflows for Compact Agents

    Jun 10, 2026Kushal Raj Bhandari, Ling Yue, Ching-Yun Ko +4Inference-Time SearchLLM Agent Workflow Optimization

  9. Notes2Skills: From Lab Notebooks to Certainty-Aware Scientific Agent Skills

    Jun 10, 2026Shi Liu, Jiayao Chen, Chengwei Qin +3AI for ScienceDocument Information Extraction

  10. DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making

    Jun 10, 2026Raffi KhatchadourianAgent EvaluationAI Agent Benchmarks

  11. ττ-Rec: A Verifiable Benchmark for Agentic Recommender Systems

    Jun 8, 2026Bharath Sivaram Narasimhan, Karthik R NarasimhanAI Agent ReliabilityAI Agent Benchmarks

  12. Auto-Configuring Scientific Simulators with Lightweight Coding-Agent Adapters

    Jun 8, 2026Matthew Ho, Brian Liu, Jixuan Chen +2Coding AgentsScientific Code Generation

  13. REFLECT: Intervention-Supported Error Attribution for Silent Failures in LLM Agent Traces

    Jun 8, 2026Xiaofeng Lin, Yingxu Wang, Tung Sum Thomas Kwok +4LLM Agent EvaluationLLM Agents

  14. The Token Not Taken: Sampling, State, and the Stochasticity of AI Agents

    Jun 8, 2026Muhammad Zia Hydari, Raja IqbalLanguage Model DecodingLLM Agents

  15. QueryWeaver: Reliable Multi-Tool Query Execution Planning via LLM-Based Graph Generation

    Jun 6, 2026Aishwarya Chakravarthy, Vidhi Kulkarni, Duen Horng ChauTool-Augmented Language Model AgentsTool-Use Planning

  16. SKILL.nb: Selective Formalization and Gated Execution for Durable Agent Workflows

    Jun 6, 2026Amine El Hattami, Nicolas Chapados, Christopher PalAI Agent ReliabilityAgentic Workflows

  17. Contract2Tool: Learning Preconditions and Effects for Reliable Tool-Augmented LLM Agents

    Jun 5, 2026Rahul Suresh Babu, Laxmipriya Ganesh IyerAI Agent ReliabilityTool-Use Evaluation

  18. The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective

    Jun 5, 2026Xiaoou Liu, Tiejin Chen, Weibo Li +2Sim-to-Real TransferAI Agent Evaluation

  19. Exploring Agentic Tool-Calling Decisions via Uncertainty-Aligned Reinforcement Learning

    Jun 5, 2026Yijin Zhou, Linqian Zeng, Xiaoya Lu +4Reinforcement LearningLLM Uncertainty Estimation

  20. From Failed Trajectories to Reliable LLM Agents: Diagnosing and Repairing Harness Flaws

    Jun 4, 2026Mengzhuo Chen, Junjie Wang, Zhe Liu +3Agent Failure AnalysisSelf-Improving Agents

  21. ToolChoiceConfusion: Causal Minimal Tool Filtering for Reliable LLM Agents

    Jun 4, 2026Rahul Suresh Babu, Laxmipriya Ganesh IyerAI Agent ReliabilityTool-Use Evaluation

  22. When Tools Fail: Benchmarking Dynamic Replanning and Anomaly Recovery in LLM Agents

    Jun 4, 2026Dongsheng Zhu, Xuchen Ma, Yucheng Shen +5AI Agent ReliabilityAI Agent Benchmarks