LLM Agent Reliability

LLM: Large Language Model

Momentum

90 papers in the last four weeks, up 109% on the four weeks before. 0.9% of all new papers.

Jul 13Week of Sep 28

Latest papers 558

All topics
CardsList
  1. VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora

    May 27, 2026Yuting Xu, Jiayi Tian, Jian Liang +4Multimodal ReasoningAI Agent Benchmarks

  2. Mobile-Aptus: Confidence-Driven Proactive and Robust Interaction in MLLM-based Mobile-Using Agents

    May 27, 2026Zheng Wu, Pengzhou Cheng, Zongru Wu +5Probability CalibrationGUI Agents

  3. OR-Space: A Full-Lifecycle Workspace Benchmark for Industrial Optimization Agents

    May 27, 2026Chenyu Zhou, Xinyun Lu, Jiangyue Zhao +3LLM Agent EvaluationAI Agent Benchmarks

  4. Detection Without Correction: A Two-Parameter Decomposition of Multi-Stage LLM Pipelines

    May 26, 2026Prashanti Nilayam, Kiran Ramanna, Prashil TumbadeLLM Self-CorrectionLLM Evaluation

  5. Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments

    May 26, 2026Yuxin Chen, Xiaodong Cai, Junfeng Fang +9LLM AgentsLLM Agent Training

  6. Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems

    May 25, 2026Jianing Zhu, Yeonju Ro, John Robertson +5AI Agent ReliabilityAI Agent Benchmarks

  7. VeriTrace: Evolving Mental Models for Deep Research Agents

    May 25, 2026Haolang Zhao, Yunbo Long, Lukas Beckenbauer +1Cognitive ModelingDeep Research Agents

  8. When Do LLM Agents Treat Surface Noise Differently from Semantic Noise? A 68-Cell Measurement Study with a Held-Out Trace-Level Validation

    May 25, 2026Liyun Zhang, Jiayi GuoCoT ReasoningLLM Agent Evaluation

  9. A Universal Cliff and a Design Fingerprint: Cross-Section Defect Detection Under LLM Orchestration

    May 25, 2026Hiroki FukuiMulti-Agent LLM SystemsLLM Evaluation

  10. CausalFlow: Causal Attribution and Counterfactual Repair for LLM Agent Failures

    May 25, 2026Akash Bonagiri, Devang Borkar, Gerard Janno Anderias +2Agent Failure AnalysisCausal Interventions in Language Models

  11. Memory-Induced Tool-Drift in LLM Agents

    May 24, 2026Mahavir Dabas, Jihyun Jeong, Ming Jin +1AI Agent BenchmarksLLM Tool Use

  12. CP-Agent: A Calibrated Risk-Controlled Agent for Feedback-Driven Competitive Programming

    May 23, 2026Peisong Wang, Bowen Liu, Zehua Li +4Code GenerationLLM-Based Program Synthesis

  13. When Planning Fails Despite Correct Execution: On Epistemic Calibration for LLM-Based Multi-Agent Systems

    May 22, 2026Zehao Wang, Shilong Jin, Zhao Cao +1Multi-Agent LLM SystemsMulti-Agent Planning

  14. DART: Semantic Recoverability for Structured Tool Agents

    May 22, 2026Ke Yang, Panpan Li, Zonghan Wu +3Agent ReliabilityRuntime Assurance

  15. Diagnosis Is Not Prescription: Linguistic Co-Adaptation Explains Patching Hazards in LLM Pipelines

    May 21, 2026Yoon Jeonghun, Kim DongchanLLM AgentsCausal Interventions in Language Models

  16. Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling

    May 20, 2026Caleb Winston, Ron Yifeng Wang, Azalia Mirhoseini +1Computer-Use AgentsLLM Agent Orchestration

  17. What Do Agents Communicate? Characterizing Information Exchange in Multi-Agent Systems

    May 19, 2026Yong Jin Chun, Iftekhar AhmedMulti-Agent CollaborationMulti-Agent Systems

  18. AgentAtlas: Beyond Outcome Leaderboards for LLM Agents

    May 19, 2026Parsa Mazaheri, Kasra MazaheriAgent Failure AnalysisComputer-Use Agent Benchmarks

  19. Modeling Emotional Dynamics in Agent-to-Agent Interactions on Moltbook

    May 19, 2026Syed Mhamudul Hasan, Abdur R. ShahidMulti-Agent LLM SystemsLLM Agent Evaluation

  20. A Methodology for Selecting and Composing Runtime Architecture Patterns for Production LLM Agents

    May 19, 2026Vasundra SrinivasanLLM Agent OrchestrationLLM Agents