LLM Agent Reliability

LLM: Large Language Model

Momentum

90 papers in the last four weeks, up 109% on the four weeks before. 0.9% of all new papers.

Jul 13Week of Sep 28

Latest papers 558

All topics
CardsList
  1. Beyond State Machines: Executing Network Procedures with Agentic Tool-Calling Sequences

    May 4, 2026Purna Sai Garigipati, Onur Ayan, Kishor Chandra Joshi +1LLM Agent OrchestrationTool-Using Agents

  2. DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis

    May 4, 2026Qiaohong Zhang, Weihao Ye, Jialong Chen +7LLM Agent ReliabilityAgent Benchmarks

  3. AutoResearch: An Execution-Grounded Multi-Agent Framework for Reliable Research Workflow Automation

    May 4, 2026Rajesh Kumar, Waqar Ali, Junaid Ahmed +2Execution-Guided Code GenerationScientific Workflow Automation

  4. EngiAgent: Fully Connected Coordination of LLM Agents for Solving Open-ended Engineering Problems with Feasible Solutions

    May 4, 2026Xiyuan Zhou, Ruixi Zou, Xinlei Wang +4Multi-Agent LLM SystemsSoftware Engineering Agents

  5. NeuroState-Bench: A Human-Calibrated Benchmark for Commitment Integrity in LLM Agent Profiles

    May 3, 2026Xiao JiaAI Agent ReliabilityLLM Agent Evaluation

  6. BaRA: Budget-constrained and Reliable Web Data Collection Agent

    May 2, 2026Soojeong Lee, Joseph Lee, Yongseong Cho +3Multimodal AgentsWeb Agents

  7. Towards Multi-Agent Autonomous Reasoning in Hydrodynamics

    May 1, 2026Jinpai Zhao, Albert Cerrone, Joannes Westerink +1Multi-Agent OrchestrationAI Agents for Scientific Discovery

  8. Are Tools All We Need? Unveiling the Tool-Use Tax in LLM Agents

    Apr 30, 2026Kaituo Zhang, Zhen Xiong, Mingyu Zhong +4Tool-Augmented Language Model AgentsAgentic Reasoning

  9. Crab: A Semantics-Aware Checkpoint/Restore Runtime for Agent Sandboxes

    Apr 30, 2026Tianyuan Wu, Chaokun Chang, Lunxi Cao +2Agent ReliabilityLLM Agent Reliability

  10. Collaborative Agent Reasoning Engineering (CARE): A Three-Party Design Methodology for Systematically Engineering AI Agents with Subject Matter Experts, Developers, and Helper Agents

    Apr 30, 2026Rahul Ramachandran, Nidhi Jha, Muthukumaran RamasubramanianLLM AgentsHuman-AI Collaboration

  11. Modeling Clinical Concern Trajectories in Language Model Agents

    Apr 30, 2026Sukesh Subaharan, Venkatesan VS, Murugadasan P +3LLM InterpretabilityAI Agent Monitoring

  12. Trace-Level Analysis of Information Contamination in Multi-Agent Systems

    Apr 30, 2026Anna Mazhar, Huzaifa Suri, Sainyam GalhotraAgentic WorkflowsAI Agent Monitoring

  13. TDD Governance for Multi-Agent Code Generation via Prompt Engineering

    Apr 29, 2026Tarlan Hasanli, Shahbaz Siddeeq, Bishwash Khanal +3LLM PromptingAI Agent Governance

  14. Autonomous LLM Agents & CTFs: A Second Look

    Apr 29, 2026Youness Bouchari, Matteo Boffa, Marco Mellia +3LLM Agent OrchestrationAI Agent Security Benchmarks

  15. Operating-Layer Controls for Onchain Language-Model Agents Under Real Capital

    Apr 28, 2026T. J. Barton, Chris Constantakis, Patti Hauseman +4AI Agent ReliabilityLLM Agent Evaluation

  16. SAFEdit: Does Multi-Agent Decomposition Resolve the Reliability Challenges of Instructed Code Editing?

    Apr 28, 2026Noam Tarshish, Nofar Selouk, Daniel Hodisan +4Execution-Guided Code GenerationMulti-Agent Coding

  17. Plausible but Wrong: A case study on Agentic Failures in Astrophysical Workflows

    Apr 28, 2026Shivam Rawat, Lucie FlekAgent Failure AnalysisAI for Science

  18. FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments

    Apr 28, 2026Amir Saeidi, Venkatesh Mishra, Souradeep Mukhopadhyay +4AI Agent ReliabilityMulti-Agent LLM Systems

  19. FastOMOP: A Foundational Architecture for Reliable Agentic Real-World Evidence Generation on OMOP CDM data

    Apr 27, 2026Niko Moeller-Grell, Shihao Shenzhang, Zhangshu Joshua Jiang +2Multi-Agent OrchestrationHealthcare

  20. From Prototype to Classroom: An Intelligent Tutoring System for Quantum Education

    Apr 27, 2026Iizalaarab Elhaimeur, Nikos ChrisochoidesMulti-Agent LLM SystemsIntelligent Tutoring Systems

  21. Analytica: Soft Propositional Reasoning for Robust and Scalable LLM-Driven Analysis

    Apr 24, 2026Junyan Cheng, Kyle Richardson, Peter ChinLLM Agent OrchestrationLLM Agents

  22. Reliable Self-Harm Risk Screening via Adaptive Multi-Agent LLM Systems

    Apr 24, 2026Meghana Karnam, Ananya JoshiAI Agent ReliabilityMulti-Agent LLM Systems