LLM Agent Reliability

LLM: Large Language Model

Momentum

90 papers in the last four weeks, up 109% on the four weeks before. 0.9% of all new papers.

Jul 13Week of Sep 28

Latest papers 558

All topics
CardsList
  1. LLMs Can't Play Hangman: On the Necessity of a Private Working Memory for Language Agents

    Jan 11, 2026Davide Baldelli, Ali Parviz, Amal Zouaq +1LLM Agent MemoryLLM Agent Reliability

  2. AOI: Context-Aware Multi-Agent Operations via Dynamic Scheduling and Hierarchical Memory Compression

    Dec 15, 2025Zishan Bai, Hanxuan Chen, Jiayi Gu +9Multi-Agent OrchestrationLLM Context Management

  3. Echo-CoPilot: A Multiple-Perspective Agentic Framework for Reliable Echocardiography Interpretation

    Dec 6, 2025Moein Heidari, Ali Mehrabian, Mohammad Amin Roohi +5Medical VQAEchocardiography

  4. CXRAgent: Director-Orchestrated Multi-Stage Reasoning for Chest X-Ray Interpretation

    Oct 24, 2025Jinhui Lou, Yan Yang, Zhou Yu +4Chest X-Ray ClassificationLLM Agent Orchestration

  5. Proof-of-Use: Mitigating Tool-Call Hacking in Deep Research Agents

    Oct 13, 2025Shengjie Ma, Chenlong Deng, Jiaxin Mao +5LLM Agent ReliabilityRL for Tool Use

  6. Domain-Specific Agents for Cherenkov Telescope Array Control Software and Gamma-Ray Data Analysis

    Oct 1, 2025Dmitriy Kostunin, Elisa Jones, Vladimir Sotnikov +3High-Energy PhysicsLLM Agents

  7. Reasoning or Rambling? Exploring the Effect of Thinking on Agent Persuasion

    Sep 25, 2025Haodong Zhao, Jidong Li, Zhaomin Wu +4LLM AgentsPersuasion in Language Models

  8. COCORELI: Enforcing Execution Preconditions for Reliable Collaborative Instruction Following

    Aug 29, 2025Swarnadeep Bhar, Omar Naim, Eleni Metheniti +4Instruction FollowingLLM Agent Planning

  9. Beyond Semantic Similarity: Reducing Unnecessary API Calls via Behavior-Aligned Retriever

    Aug 20, 2025Yixin Chen, Ying Xiong, Shangyu Wu +4In-Context Example SelectionIn-Context Retrieval

  10. EndoCogniAgent: Closed-Loop Agentic Reasoning with Self-Consistency Validation for Endoscopic Diagnosis

    Aug 10, 2025Yi Tang, Kai-Ni Wang, Liang-Peng Pu +3EndoscopyMedical Imaging

  11. From the Fluency Fallacy to the Micro-to-Macro Validity Gap: Opportunities and Pitfalls of LLMs in Social Simulation

    Jul 25, 2025Patrick Taillandier, Jean Daniel Zucker, Arnaud Grignard +4Human Behavior SimulationComputational Social Science

  12. Towards Mitigation of Hallucination for LLM-empowered Agents: Progressive Generalization Bound Exploration and Watchdog Monitor

    Jul 21, 2025Siyuan Liu, Wenjing Liu, Zhiwei Xu +3LLM Hallucination MitigationHallucination in Language Models

  13. SheetMind: Actions Set Accuracy, Agents Set the Failure Mode

    Jun 14, 2025Lyuhao Chen, Xi Cheng, Yanming Kang +11Multi-Agent LLM SystemsLLM Agent Evaluation

  14. DrugAgent: Reliable Multi-Agent Integration of Conflicting Biomedical Evidence for Drug-Target Interaction Assessment

    Aug 23, 2024Yoshitaka Inoue, Tianci Song, Xinling Wang +3Multi-Agent LLM SystemsLLM Agent Reliability

  15. GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science

    Date pendingAleksandr Tsymbalov, Danis Zaripov, Artem Epifanov +1LLM Agent EvaluationAI Agent Benchmarks