Long-Horizon Agent Evaluation

Momentum

48 papers in the last four weeks, up 182% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 235

All topics
CardsList
  1. Can AI Agents Learn Their Way to the Top? Evaluating Heuristic Learning in a Long-Running Game Agent Competition

    Oct 8, 2026Kaisen Yang, Qingle Liu, Kejin Wang +24Game-Playing AgentsSelf-Improving Agents

  2. Mine Odyssey: Benchmarking Spatial Agentic Intelligence in the Wild

    Oct 8, 2026Yuxuan Cao, Junlong Li, Hao Li +1AI Agent BenchmarksSpatial Reasoning Benchmarks

  3. AgentHorizon: Evaluating Agentic Judges for Long-Horizon Computer-Use Tasks

    Oct 8, 2026Xing Han Lù, Dheeraj Vattikonda, Sina Hajimiri +7Computer-Use Agent BenchmarksLong-Horizon Agent Evaluation

  4. AgentTime: Can Agents Estimate and Control Their Own Runtime?

    Oct 7, 2026Michael Ofengenden, Maksym AndriushchenkoAI Agent BenchmarksLong-Horizon Agent Evaluation

  5. LiveMACE: Process-Aware Evaluation of LLM Agent Capabilities in Evolving Markets

    Oct 7, 2026Jun Zhao, Leiming Fu, Yanbo Wen +9LLM Agent EvaluationAI Agent Benchmarks

  6. Transect: Retaining Observability for Long-Horizon LLM Agent Evaluations

    Oct 6, 2026Toby D. Pilditch, Konstantinos Voudouris, Alexandra Abbas +1LLM Agent EvaluationLong-Horizon Agent Evaluation

  7. What Did the Agent Actually Do? Evidence-Grounded Oversight for Long-Horizon Agents

    Oct 5, 2026Zhongxiang Sun, Jiahao Yan, Hongkang Zhao +5Software Engineering AgentsHuman-in-the-Loop Evaluation

  8. EMBER-Bench: Benchmarking Cross-Event Causal Memory in Long-Horizon Embodied Tasks

    Oct 4, 2026Aoyang Cai, Boning Zhao, Shaoxuan Xie +5Next-Action PredictionEmbodied QA

  9. ReLiveGym: Evaluating Long-Lived Agents over Weeks of Replayed Reality

    Sep 30, 2026Xisen Jin, Jingheng Li, Zhenglun Chen +2Continual Learning for LLM AgentsLong-Horizon Agent Evaluation

  10. EurekaBench: Measuring Agentic Ability to Discover New Scientific Insights

    Sep 30, 2026Jiayi Geng, Zhengxuan Wu, Kevin S. Chen +12Scientific DiscoveryLong-Horizon Agent Evaluation

  11. EngramBench: A Capability-Grounded Benchmark for Skill-Evolution Harnesses

    Sep 30, 2026Zhixuan Tan, Pengjie Gu, Zhao Li +4Software Engineering BenchmarksLong-Horizon Agent Evaluation

  12. When Harnesses Lose the Signal: Causal Evaluation of Recovery in LLM Agents

    Sep 30, 2026Shuyao Xiao, Shengling Wang, Xuan Chen +7Long-Horizon Agent EvaluationCausal Interventions in Language Models

  13. EnterpriseBench: Benchmarking LLM Agents on Enterprise-Level Strategic Reasoning and Decision-Making

    Sep 29, 2026Min Yang, Yichen Pan, Jinghua Piao +3AI-Assisted Decision MakingLLM Agent Evaluation

  14. LoLBench: Evaluating Coding Agents with Long-Horizon Proposals on Large Software Systems

    Sep 29, 2026Yun Peng, Zihan Wu, Zeyang Zhuang +6Software EngineeringAI Coding Agents

  15. Traverse: Learning When to Remember, Reset, and Redirect for Long-Horizon Web Search

    Sep 29, 2026Jingyuan Ma, Lynx Aster, He Zhang +5Long-Horizon Agent EvaluationWeb Search Agents

  16. PrecogUI: Proactive GUI Agents via Pre-cognitive Simulation and Experience Retrieval

    Sep 29, 2026Bin Kang, Jiarui Ouyang, Li Jiang +2GUI AgentsLong-Horizon Agent Evaluation

  17. StateTape: Action-Conditioned Evidence Lifecycle Modeling for Long-Horizon Coding Agents

    Sep 28, 2026Ziyang Yu, Liang Zhao, Bowen Zhu +1AI Coding AgentsLLM Agent Memory

  18. ARISE: Adapting to Evolving Capability Gaps in Agentic Reinforcement Learning

    Sep 28, 2026Kun Feng, Yuchen Fang, Yiyang Tan +6Agentic RLLong-Horizon Agent Evaluation

  19. Long-Horizon Scaling: How Model Capabilities Shape the Returns to Computation

    Sep 28, 2026Haoyu Zheng, Zhengyu Chen, Huaisheng Zhu +5Cost-Aware InferenceInference-Time Scaling

  20. PDEU-Bench: Benchmarking the Personalized Planning Lifecycle of Tool-Calling LLM Agents

    Sep 28, 2026Huayi Lai, Shichao Song, Qingchen Yu +4Long-Horizon Agent EvaluationAI Agent Benchmarks

  21. CEO Arena: Evaluating Long-Horizon Multi-Agent Decision-Making in Competitive Markets

    Sep 28, 2026An Yan, Yu Huo, Zhiwei Shang +2Game TheoryLLM Agent Evaluation

  22. LongPuzzleBench: Evaluating GUI Agents on Long-Horizon Visual Puzzles

    Sep 28, 2026Bingo Zhang, Haochuan Lu, Zongjie Li +3GUI AgentsLong-Horizon Agent Evaluation

  23. FromPitch2Board: Benchmarking LLM Agents in Long-Horizon Football Management

    Sep 28, 2026Peiyu ZangLong-Horizon Agent EvaluationAI Agent Benchmarks