Long-Horizon Agent Evaluation

Momentum

48 papers in the last four weeks, up 182% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 235

All topics
CardsList
  1. ShiJianBench: From Dialogue to Decision for Long-Horizon Evaluation of Investment Advisors

    Aug 2, 2026Jie Gong, Maowei Jiang, Zhiwei Liu +14Financial ServicesLong-Horizon Agent Evaluation

  2. OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

    Aug 1, 2026Yunhao Chen, Xin Wang, Yixu Wang +6Adversarial AttacksLong-Horizon Agent Evaluation

  3. LoopsBench: From Harness Engineering to Loop Engineering in Coding Agent Evaluation

    Jul 31, 2026Han Li, Zhemin Fang, Rili Feng +8AI Coding AgentsSoftware Engineering Benchmarks

  4. Cross-Benchmark Generalization in Long-Horizon Agents

    Jul 31, 2026Sushant Mehta, Logan Ritchie, Liudas Panavas +1Long-Horizon Agent EvaluationRL Post-Training

  5. MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

    Jul 31, 2026Qiming Shi, Yulong Tao, Linbo Jin +10LLM Agent EvaluationLong-Horizon Agent Evaluation

  6. SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

    Jul 25, 2026Yang Wan, Zhenhao Zhang, Jierui Wang +1Reward ModelingLLM-as-a-Judge

  7. MEMENTO: Memory-Guided Memetic Code-as-Policy Evolution

    Jul 24, 2026Alkis Sygkounas, Victor Aregbede, Amy Loutfi +1Metaheuristic OptimizationLarge Language Model-Guided Optimization

  8. Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents

    Jul 24, 2026Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt +5Zero-Shot LearningMultimodal Large Language Models

  9. DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations

    Jul 22, 2026Jiazhen Jiang, Boxi Cao, Lingyong Yan +6Long-Horizon Agent EvaluationAI Agent Benchmarks

  10. EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World

    Jul 19, 2026Qing Zong, Yue Guo, Mengxin Yang +2Long-Horizon Agent EvaluationLLM Agents

  11. CLOSER-Bench: Evaluating Budgeted Cross-Stage Design Closure for Hardware Agents

    Jul 18, 2026Peilong Zhou, Zhirong Chen, Cangyuan Li +4Benchmark DesignElectronic Design Automation

  12. MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations

    Jul 14, 2026Xixuan Hao, Zeyu Zhang, Zehao Lin +6Conversational MemoryPersistent Memory for Language Models

  13. The Compliance Trap: Diagnosing How AI Agents Consume Conflicting Memory

    Jul 12, 2026Yixiong Chen, Xinyi Bai, Alan YuilleWeb Agent BenchmarksLong-Horizon Agent Evaluation

  14. DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers

    Jul 10, 2026Jerzy Kamiński, Ilya Galyukshev, Artem Kuznetsov +4Computer-Use Agent BenchmarksLLM Agent Evaluation

  15. LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making

    Jul 10, 2026Zihan Xu, Yanzhen Chen, Xiaocheng Zhang +4Long-Horizon Agent EvaluationClinical Decision-Making

  16. Scoped Verification for Reliable Long-Horizon Agentic Context Evolution under Distribution Shift

    Jul 10, 2026Dan C. Hsu, Luke LuAI Agent ReliabilityLong-Horizon Agent Evaluation

  17. Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

    Jul 9, 2026Zongxia Li, Zhongzhi Li, Yucheng Shi +10Long-Horizon Agent EvaluationAI Agent Benchmarks

  18. PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents

    Jul 7, 2026Hongliang Li, Yijin Liu, Zhiwei Zhang +5Multilingual Language Model EvaluationLong-Horizon Agent Evaluation