Long-Horizon Agent Evaluation

Momentum

48 papers in the last four weeks, up 182% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 235

All topics
CardsList
  1. AndroidDaily: A Verifiable Benchmark for Mobile GUI Agents on Real-World Closed-Source Applications

    May 26, 2026Yifan Sui, Xin Huang, Hongbing Li +14Mobile GUI AutomationComputer-Use Agent Benchmarks

  2. Benchmarks are Not Enough: RAMP for Runtime Assessing of Agentic Models in Production Systems

    May 26, 2026Yipeng Ouyang, Xin Huang, Bingjie Liu +3Software Engineering AgentsLLM Agent Evaluation

  3. VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions

    May 26, 2026Yuxin Chen, Yi Zhang, Zhengzhou Cai +11LLM Agent MemoryAI Agent Evaluation

  4. Persistent AI Agents in Academic Research: A Single-Investigator Implementation Case Study

    May 26, 2026Anas H. AlzahraniLong-Horizon Agent EvaluationAI Agent Governance

  5. EvoCode-Bench: Evaluating Coding Agents in Multi-Turn Iterative Interactions

    May 22, 2026Haiyang Shen, Xuanzhong Chen, Wendong Xu +3AI Coding AgentsSoftware Engineering Benchmarks

  6. TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks

    May 21, 2026Zhaoyang Chu, Jiarui Hu, Xingyu Jiang +8Computer-Use Agent BenchmarksTerminal Agents

  7. Open-World Evaluations for Measuring Frontier AI Capabilities

    May 19, 2026Sayash Kapoor, Peter Kirgis, Andrew Schwartz +15AI Agent EvaluationLong-Horizon Agent Evaluation

  8. CutVerse: A Compositional GUI Agents Benchmark for Media Post-Production Editing

    May 19, 2026Haobo Hu, Xiangwu Guo, Zhiheng Chen +4GUI AgentsVideo Editing

  9. DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows

    May 18, 2026Yuxuan Gao, Megan Wang, Yi Ling Yu +2LLM Agent OrchestrationLong-Horizon Agent Evaluation

  10. MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents

    May 18, 2026Ziyun Zeng, Hang Hua, Bocheng Zou +3Multimodal MemoryGUI Agents

  11. MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems

    May 18, 2026Hyunji Lee, Justin Chih-Yao Chen, Joykirat Singh +3Agent MemoryLong-Horizon Agent Evaluation

  12. Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents

    May 18, 2026Ahmad Al-Tawaha, Shangding Gu, Peizhi Niu +2Long-Horizon Agent EvaluationLLM Safety Evaluation

  13. SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering

    May 17, 2026Qingnan Ren, Shun Zou, Shiting Huang +11Software EngineeringAI Coding Agents

  14. CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?

    May 15, 2026Haolin Chen, Deon Metelski, Leon Qi +30HealthcareLong-Horizon Agent Evaluation

  15. RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

    May 15, 2026Xinbo Xu, Ruihan Yang, Haiyang Shen +13AI Coding AgentsSoftware Engineering Benchmarks

  16. FutureSim: Replaying World Events to Evaluate Adaptive Agents

    May 14, 2026Shashwat Goel, Nikhil Chandak, Arvindh Arun +5Continual Test-Time AdaptationForecasting Benchmarks

  17. MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory

    May 14, 2026Minghao Guo, Qingyue Jiao, Zeru Shi +14Multimodal MemoryAI Agent Evaluation

  18. Holistic Evaluation and Failure Diagnosis of AI Agents

    May 14, 2026Netta Madvil, Gilad Dym, Alon Mecilati +12Agent Failure AnalysisAI Agent Evaluation

  19. ππ-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows

    May 14, 2026Haoran Zhang, Luxin Xu, Zhilin Wang +11Long-Horizon Agent EvaluationAI Agent Benchmarks

  20. TwinRouterBench: Fast Static and Live Dynamic Evaluation for Realistic Agentic LLM Routing

    May 14, 2026Pei Yang, Wanyi Chen, Tongyun Yang +15Benchmark DesignLLM Agent Evaluation

  21. When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution

    May 14, 2026Zilin Zhu, Longteng Guo, Yanghong Mei +5Long-Horizon PlanningLong-Horizon Agent Evaluation

  22. Why We Need World Models for AGI: Where LLMs Fail and How World Models May Outperform

    May 13, 2026Feisal Alaswad, Batoul Aljaddouh, Maher Alrahhal +2Latent Dynamics ModelingLong-Horizon Agent Evaluation

  23. Ego2World: Compiling Egocentric Cooking Videos into Executable Worlds for Belief-State Planning

    May 13, 2026Qinchuan Cheng, Zhantao Gong, Pengzhan Sun +3Belief-Space PlanningLong-Horizon Agent Evaluation

  24. MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare

    May 12, 2026Yihao Wang, Haoran Xu, Renjie Gu +10Agent MemoryHealthcare

  25. PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments

    May 12, 2026Yunn Kang Lim, Pengzhan Sun, Ziyi Bai +4Long-Horizon Agent EvaluationAI Agent Benchmarks

  26. WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation

    May 11, 2026Shuangrui Ding, Xuanlang Dai, Long Xing +14Computer-Use Agent BenchmarksTool-Augmented Language Model Agents