LLM Agent Reliability

LLM: Large Language Model

Momentum

90 papers in the last four weeks, up 109% on the four weeks before. 0.9% of all new papers.

Jul 13Week of Sep 28

Latest papers 558

All topics
CardsList
  1. UA-ChatDev: Uncertainty-Aware Multi-Agent Collaboration for Reliable Software Development

    Jul 2, 2026Temitayo Olamilekan Ogunsusi, Lijun Qian, Xishuang DongSoftware Engineering AgentsMulti-Agent Collaboration

  2. Atomic Task Graph: A Unified Framework for Agentic Planning and Execution

    Jul 2, 2026Yue Zhang, Sihan Chen, Ziwen Huang +3Graph-Based PlanningLLM Agent Planning

  3. CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training

    Jul 2, 2026Fangfei Li, Chenyang Zhao, Long Wang +3LLM Agent EvaluationLLM Post-Training

  4. When Should Service Agents Reconsider? Difficulty-Routed Control in Customer-Service Operations

    Jul 1, 2026Qian Chen, Chengyuan Liu, Xin YuCustomer Support AutomationTool-Using Agents

  5. Can Agents Generalize to the Open World? Unveiling the Fragility of Static Training in Tool Use

    Jul 1, 2026Song-Lin Lv, Weiming Wu, Rui Zhu +2Fine-TuningDistribution Shift

  6. PHREEQC-MCQ-200: A Diagnostic Benchmark for Tool-Augmented Scientific Simulator Agents

    Jul 1, 2026Ke Zhang, Sahchit Chundur, Mohammad Javad Qomi +1Computer-Use Agent BenchmarksAI for Science

  7. Entity Binding Failures in Tool-Augmented Agents

    Jun 29, 2026Rahul Suresh Babu, Shashank IndukuriTool-Using AgentsLLM Agent Safety

  8. A Diagnostic Framework and Multi-Evaluator Audit of Evaluator-Driven Preference Dynamics in Self-Adapting LLM Agents

    Jun 29, 2026Liu ZewenLLM EvaluationLLM Agent Evaluation

  9. SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution

    Jun 29, 2026Aojie Yuan, Yi Nian, Haiyue Zhang +2AI Agent ReliabilityProcess Reward Models

  10. Budgeted Act-or-Defer Multi-Agent LLM Deliberation with Local Reliability Bounds

    Jun 28, 2026Mengdie Flora Wang, Haochen Xie, Guanghui Wang +2AI Agent ReliabilityMulti-Agent LLM Systems

  11. Minority Sentinel: When to Overturn Majority Voting in Multi-Agent LLM Debates

    Jun 28, 2026Chuan He, Zebin Chen, Zhengyi Yang +5Multi-Agent DebateMulti-Agent Consensus

  12. Characterizing Large Language Model Agentic Workflows: A Study on N8n Ecosystem

    Jun 27, 2026Yutian Tang, Yuming Zhou, Huaming ChenAgentic WorkflowsHuman-in-the-Loop AI

  13. Memory as an Attack Surface in LLM Agents: A Study on Multiple-Choice Question Answering

    Jun 27, 2026Shahnewaz Karim Sakib, Anindya Bijoy DasAgent Memory PoisoningLLM Agent Reliability

  14. Preventing Error Propagation in Multi-Agent AI through Runtime Monitoring

    Jun 27, 2026Shahnewaz Karim Sakib, Anindya Bijoy DasAI Agent ReliabilityMulti-Agent Systems

  15. Glite ARF: Verifier-Driven Research with Parallel LLM Coding Agents

    Jun 25, 2026Vassili Philippov, Pavel Katunin, Dmitry Andreev +2Multi-Agent CodingAutonomous Research Agents

  16. Making Failure Safe: A Constrained, Verifiable Agent Framework for Open-Web Data Collection

    Jun 25, 2026Bo ChenConstrained Generative ModelingWeb Agents

  17. What the LLM Should Not Say: Boundary-Aware Context Grounding for A Seven-Channel EEG Agent

    Jun 25, 2026Zhiyuan Xu, Yueqing Dai, Junling Li +1ElectroencephalographyLLM Grounding

  18. Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems

    Jun 24, 2026Ching-Yu Lin, Yifan LiuLLM Agent EvaluationLLM Agent Reliability

  19. Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability

    Jun 24, 2026Yang Tian, Zhengpeng Shi, Yu Zhou +1AI Agent ReliabilityAI Agent Benchmarks

  20. Constraint Tax in Open-Weight LLMs: An Empirical Study of Tool Calling Suppression Under Structured Output Constraints

    Jun 24, 2026Fangzheng Li, Aimin Zhang, Chen LvConstrained DecodingLLM Tool Use

  21. TRUSTMEM: Learning Trustworthy Memory Consolidation for LLM Agents with Long-Term Memory

    Jun 23, 2026Tianyu Yang, Sudipta Paul, Vijay Srinivasan +2LLM Agent MemoryAgent Memory Management

  22. Agon: An Autonomous Large-Scale Omnidisciplinary Research System Built on Prompt Economy

    Jun 23, 2026Youran Sun, Xingyu Ren, Chugang Yi +4AI Agents for Scientific DiscoveryHuman-in-the-Loop AI

  23. When Robots Rate Their Own Interactions: Engagement Validity and the Strangeness Failure

    Jun 22, 2026Victor Lockwood, Hasan Mahmud, Mohammad Javad Khojasteh +2LLM Agent EvaluationHuman-Robot Interaction

  24. Position: Correct Answer, Wrong Mechanism -- When AI Scientists Defend General Claims Their Own Data Contradicts

    Jun 22, 2026Steven Young EuligAI Agent ReliabilityReasoning Evaluation