LLM Agent Evaluation

LLM: Large Language Model

Momentum

115 papers in the last four weeks, up 140% on the four weeks before. 1.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 793

All topics
CardsList
  1. LLM Agents for Deliberative Collaboration: A Study on Joint Decision Making Under Partial Observability

    Jul 7, 2026Chenxu Wang, Yongkun Yang, Boyuan Du +2LLM Agent EvaluationMulti-Agent Collaboration

  2. AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation

    Jul 7, 2026Andrey Podivilov, Vadim Lomshakov, Sergey Savin +4Computer-Use Agent BenchmarksAI Coding Agents

  3. WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

    Jul 7, 2026Wei Dong, Tianyu Fu, Zhe Yu +9LLM-as-a-JudgeWeb Agent Benchmarks

  4. Onnes: A Physics-Grounded Multi-Agent LLM Simulator for Cryogenic Fault Diagnosis in Quantum Computing Infrastructure

    Jul 7, 2026Praneeth Narisetty, Uday Kumar Reddy Kattamanchi, Shiva Nagendra Babu KoreMulti-Agent LLM SystemsLLM Agent Evaluation

  5. LLM-as-a-Verifier: A General-Purpose Verification Framework

    Jul 6, 2026Jacky Kwok, Shulu Li, Pranav Atreya +6LLM Answer VerificationLLM Agent Evaluation

  6. AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments

    Jul 6, 2026Zhiheng Xi, Dingwen Yang, Jiaqi Liu +22LLM Agent EvaluationAI Agent Benchmarks

  7. When Agents Lie: Premeditation, Persistence, and Exploitation in Repeated Games

    Jul 6, 2026Jerick Shi, Terry Jingcheng Zhang, Bernhard Schölkopf +2Multi-Agent LLM SystemsGame-Playing Agents

  8. Decision Protocols in Multi-Agent Large Language Model Conversations

    Jul 6, 2026Lars Benedikt KaesbergMulti-Agent LLM SystemsLLM Agent Evaluation

  9. Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents

    Jul 5, 2026Haiwen Yi, Xinyuan SongSoftware Engineering AgentsLLM Agent Evaluation

  10. Autonomous Information Seeking: A Roadmap for Agentic Recommender Systems

    Jul 5, 2026Xinyu Lin, Yashar Deldjoo, Sunhao Dai +7LLM Agent EvaluationRecommender Systems

  11. Agent Step Value: Auditing Evaluator-Channel Reversals in Black-Box Agent Traces

    Jul 5, 2026Andrew Zhang, Chengzhan LiLLM Agent EvaluationAI Agent Evaluation

  12. HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation

    Jul 5, 2026Yaozu Wu, Wei-Chieh Huang, Jizhou Guo +11LLM Agent EvaluationHuman-in-the-Loop Evaluation

  13. The "I Don't Know" Filter: Enhancing Agentic Reliability in Function Calling

    Jul 4, 2026Stefan Broecker, Mason del Rosario, Boris Selitser +1AI Agent ReliabilityLLM Agent Evaluation

  14. ProACT: Towards Breakdown-Aware Proactive Agent in Multi-User Collaboration

    Jul 4, 2026Shu Yang, Difei Xu, Jiaxin Pei +1LLM Agent EvaluationProactive Assistance

  15. When Aggregate Alignment Misleads: Auditing Policy Repair Without Per-State Expert Actions

    Jul 3, 2026Peiying Zhu, Sidi ChangLLM Agent EvaluationPolicy Evaluation

  16. Agentic and Generative AI for Open-Source Intelligence and Cyber Investigations: Taxonomy, Evaluation, Challenges, and Future Directions

    Jul 3, 2026Eduardo Almeida Palmieri, Mohamed Chahine Ghanem, Dipo Dunsin +3LLM Agent EvaluationLLMs for Cybersecurity

  17. APeB: Benchmarking Personalization Ability of Large Language Model Agents

    Jul 3, 2026Garry Yang, Zizhe Chen, Xinru Chen +9LLM PersonalizationLLM Agent Evaluation

  18. Evaluating Generative Agents with Actions Grounded in Socially Distributed Task Environments using Incognita

    Jul 3, 2026Dan C. Hsu, Luke LuLLM Agent EvaluationAI Agent Benchmarks

  19. MedCalc-Pro: Solving Complex Medical Calculations with LLM Agents

    Jul 3, 2026Siran Zhao, Ruihui Hou, Ziyue Huai +2LLM Agent EvaluationLLM Tool Use

  20. Determinants and Limits of LLM Security-Tool Orchestration: A Study with HexStrike-AI

    Jul 3, 2026Romain Gerard, Assmaa Zeghaider, Yan GuoLLM Agent OrchestrationLLM Agent Evaluation

  21. What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates

    Jul 2, 2026Arman Ghaffarizadeh, Danyal Mohaddes, Aliakbar Izadkhah +1LLM Agent EvaluationMulti-Agent Debate

  22. Coding-agents can replicate scientific machine learning papers

    Jul 2, 2026Atharva Hans, Ilias BilionisCoding AgentsLLM Agent Evaluation

  23. PACE: A Proxy for Agentic Capability Evaluation

    Jul 2, 2026Yueqi Song, Lintang Sutawika, Jiarui Liu +8Benchmark DesignLLM Agent Evaluation

  24. SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

    Jul 2, 2026Jiayin Zhu, Kelong Mao, Yudong Guo +4LLM Agent EvaluationLLM Agent Skill Learning

  25. CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training

    Jul 2, 2026Fangfei Li, Chenyang Zhao, Long Wang +3LLM Agent EvaluationLLM Post-Training

  26. AgenticDataBench: A Comprehensive Benchmark for Data Agents

    Jul 2, 2026Zhaoyan Sun, Shan Zhong, Daizhou Wen +10LLM Agent EvaluationAI Agent Benchmarks