Long-Horizon Agent Evaluation

Momentum

47 papers in the last four weeks, up 176% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 232

All topics
CardsList
  1. Persistent AI Agents in Academic Research: A Single-Investigator Implementation Case Study

    May 26, 2026Anas H. AlzahraniLong-Horizon Agent EvaluationAI Agent Governance

  2. EvoCode-Bench: Evaluating Coding Agents in Multi-Turn Iterative Interactions

    May 22, 2026Haiyang Shen, Xuanzhong Chen, Wendong Xu +3AI Coding AgentsSoftware Engineering Benchmarks

  3. TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks

    May 21, 2026Zhaoyang Chu, Jiarui Hu, Xingyu Jiang +8Computer-Use Agent BenchmarksTerminal Agents

  4. Open-World Evaluations for Measuring Frontier AI Capabilities

    May 19, 2026Sayash Kapoor, Peter Kirgis, Andrew Schwartz +15AI Agent EvaluationLong-Horizon Agent Evaluation

  5. CutVerse: A Compositional GUI Agents Benchmark for Media Post-Production Editing

    May 19, 2026Haobo Hu, Xiangwu Guo, Zhiheng Chen +4GUI AgentsVideo Editing

  6. DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows

    May 18, 2026Yuxuan Gao, Megan Wang, Yi Ling Yu +2LLM Agent OrchestrationLong-Horizon Agent Evaluation

  7. MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents

    May 18, 2026Ziyun Zeng, Hang Hua, Bocheng Zou +3Multimodal MemoryGUI Agents

  8. MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems

    May 18, 2026Hyunji Lee, Justin Chih-Yao Chen, Joykirat Singh +3Agent MemoryLong-Horizon Agent Evaluation

  9. Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents

    May 18, 2026Ahmad Al-Tawaha, Shangding Gu, Peizhi Niu +2Long-Horizon Agent EvaluationLLM Safety Evaluation

  10. SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering

    May 17, 2026Qingnan Ren, Shun Zou, Shiting Huang +11Software EngineeringAI Coding Agents

  11. CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?

    May 15, 2026Haolin Chen, Deon Metelski, Leon Qi +30HealthcareLong-Horizon Agent Evaluation

  12. RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

    May 15, 2026Xinbo Xu, Ruihan Yang, Haiyang Shen +13AI Coding AgentsSoftware Engineering Benchmarks

  13. FutureSim: Replaying World Events to Evaluate Adaptive Agents

    May 14, 2026Shashwat Goel, Nikhil Chandak, Arvindh Arun +5Continual Test-Time AdaptationForecasting Benchmarks

  14. MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory

    May 14, 2026Minghao Guo, Qingyue Jiao, Zeru Shi +14Multimodal MemoryAI Agent Evaluation

  15. Holistic Evaluation and Failure Diagnosis of AI Agents

    May 14, 2026Netta Madvil, Gilad Dym, Alon Mecilati +12Agent Failure AnalysisAI Agent Evaluation

  16. ππ-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows

    May 14, 2026Haoran Zhang, Luxin Xu, Zhilin Wang +11Long-Horizon Agent EvaluationAI Agent Benchmarks

  17. TwinRouterBench: Fast Static and Live Dynamic Evaluation for Realistic Agentic LLM Routing

    May 14, 2026Pei Yang, Wanyi Chen, Tongyun Yang +15Benchmark DesignLLM Agent Evaluation

  18. When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution

    May 14, 2026Zilin Zhu, Longteng Guo, Yanghong Mei +5Long-Horizon PlanningLong-Horizon Agent Evaluation

  19. Why We Need World Models for AGI: Where LLMs Fail and How World Models May Outperform

    May 13, 2026Feisal Alaswad, Batoul Aljaddouh, Maher Alrahhal +2Latent Dynamics ModelingLong-Horizon Agent Evaluation

  20. Ego2World: Compiling Egocentric Cooking Videos into Executable Worlds for Belief-State Planning

    May 13, 2026Qinchuan Cheng, Zhantao Gong, Pengzhan Sun +3Belief-Space PlanningLong-Horizon Agent Evaluation

  21. MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare

    May 12, 2026Yihao Wang, Haoran Xu, Renjie Gu +10Agent MemoryHealthcare

  22. PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments

    May 12, 2026Yunn Kang Lim, Pengzhan Sun, Ziyi Bai +4Long-Horizon Agent EvaluationAI Agent Benchmarks

  23. WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation

    May 11, 2026Shuangrui Ding, Xuanlang Dai, Long Xing +14Computer-Use Agent BenchmarksTool-Augmented Language Model Agents

  24. AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents

    May 8, 2026Zhengkang Guo, Yiyang Li, Lin Qiu +7LLM Agent EvaluationLong-Horizon Agent Evaluation

  25. Stop Comparing LLM Agents Without Disclosing the Harness

    May 7, 2026Yunbei Zhang, Janet Wang, Yingqiang Ge +3LLM Agent EvaluationLong-Horizon Agent Evaluation