LLM Agent Reliability

LLM: Large Language Model

Momentum

90 papers in the last four weeks, up 109% on the four weeks before. 0.9% of all new papers.

Jul 13Week of Sep 28

Latest papers 558

All topics
CardsList
  1. Mitigating Context Interference for Reliable and Efficient Search Agents

    Aug 11, 2026Boyang Xue, Bin Wu, Shuofei Qiao +8LLM AgentsLLM Context Management

  2. FlowScout: From Execution Feedback to Reliable Tool-Using Agent Workflows

    Aug 10, 2026Shuo Hao, You Lu, Bihuan Chen +1Agentic WorkflowsLLM Agent Workflow Optimization

  3. SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance

    Aug 10, 2026You Lu, Xinyu Huang, Bihuan Chen +1LLM Agent Skill LearningLLM Agents

  4. Agentic Router: An Execution-Grounded Continual Learning Approach With Memory

    Aug 10, 2026Yuxuan Chen, Rongpeng Li, Zhifeng Zhao +3Continual Learning for LLM AgentsLLM Agents

  5. Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives

    Aug 8, 2026Yingpeng Ma, Jianhao Yan, Bei Shi +6Interactive StorytellingAI Agent Benchmarks

  6. Verication-driven closed-loop multi-agent large language modelframework for code-compliant structural design

    Aug 8, 2026Jianbin Luo, Weibin Lin, Yiran Lin +2Multi-Agent LLM SystemsLLM Agent Reliability

  7. Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing

    Aug 7, 2026Jiacheng Miao, Jin Mu, Guanhua Chen +1AI Agent BenchmarksLLM Agent Training

  8. WebRider: Persona-Conditioned Intent Controllers for Live-Web Assistance

    Aug 7, 2026Zhi Li, Tao Zhou, Yeqing Li +2LLM Agent EvaluationTool-Using Agents

  9. Online Monitoring and Corrective Steering of Programming Agents

    Aug 7, 2026Shuyang Liu, Saman Dehghan, Ji Young Kim +3Software Engineering AgentsLLM Agent Workflow Optimization

  10. Toward Reliable Context Compression for Long-Horizon Agents: An Empirical Study of Execution Instability

    Aug 6, 2026Guanghui Min, Liang Wu, Mayank Darbari +2AI Agent EvaluationLong-Horizon LLM Agents

  11. When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories

    Aug 6, 2026Xiaoqing Wu, Xingyu Fan, Feifei Li +1Tool-Use EvaluationLLM Tool Use

  12. OPERA: Operator-residual feedback for reliable autonomous optical experiments with language-model agents

    Aug 6, 2026Ning Xu, Xiang Zheng, Fuqiang Zhong +4Feedback ControlAutonomous Experimentation

  13. ChainClaw: A Layered Agent Framework for Reliable On-Chain Execution

    Aug 6, 2026Jiacheng Wei, Zhaoxin Fan, Xin Wen +5LLM Agent OrchestrationAI Agent Monitoring

  14. SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation

    Aug 6, 2026Yuru Feng, Yaoqi Chen, Beidi Zhao +7Test-Time AdaptationLLM Agent Self-Improvement

  15. EviGraph: Evidence-Guided Autonomous Research Agents

    Aug 5, 2026Zhenjiang Ren, Ruiji Li, Xujing Zhang +3Evidence-Grounded ReasoningEvidence-Grounded Generation

  16. SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents

    Aug 5, 2026Zhixiang Liang, Yifei Liu, Yidan Huang +5Agent Failure AnalysisAI Agent Reliability

  17. Post-Hoc Trajectory-Risk Certification for Modular LLM-Based Security Agents

    Aug 4, 2026Zhenpeng LiIoT Intrusion DetectionCybersecurity

  18. Formal Verification of Agentic Systems over Operational Data

    Aug 4, 2026Alejandro J. Mercado, Alessio LomuscioFormal VerificationLLM Agent Harnesses

  19. When Truth Is Distributed: Misinformation Derails Collective Fact Recovery in LLM-Based Multi-Agent Systems

    Aug 4, 2026Chenfei Yan, Zeyang Yue, Feifei Zhao +6AI Agent EvaluationMulti-Agent Systems

  20. Towards Robust Tool Use in Agents via Experience-Driven Adaptive Guidance

    Aug 4, 2026Can Wang, Haoran Chen, Li Yu +4Tool-Using AgentsLLM Tool Use

  21. Fail-Fast, Restart-Smart: Early Failure Prediction and Restart for SWE Agentic Tasks

    Aug 4, 2026Chenyu Wang, Yunbo Lyu, Junda He +4Software Engineering AgentsAI Agent Monitoring

  22. Don't Regenerate, Debug: A Domain-Specific Agent for Repairing Near-Miss Hardware Operators

    Aug 3, 2026Yansong Sun, Shenxiu Wu, Siyuan Chen +6Automated Program RepairGPU Kernel Generation