Long-Horizon Agent Evaluation

Momentum

47 papers in the last four weeks, up 176% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 228

All topics
CardsList
  1. What Did the Agent Actually Do? Evidence-Grounded Oversight for Long-Horizon Agents

    Oct 5, 2026Zhongxiang Sun, Jiahao Yan, Hongkang Zhao +5Software Engineering AgentsHuman-in-the-Loop Evaluation

  2. EMBER-Bench: Benchmarking Cross-Event Causal Memory in Long-Horizon Embodied Tasks

    Oct 4, 2026Aoyang Cai, Boning Zhao, Shaoxuan Xie +5Next-Action PredictionEmbodied QA

  3. ReLiveGym: Evaluating Long-Lived Agents over Weeks of Replayed Reality

    Sep 30, 2026Xisen Jin, Jingheng Li, Zhenglun Chen +2Continual Learning for LLM AgentsLong-Horizon Agent Evaluation

  4. EurekaBench: Measuring Agentic Ability to Discover New Scientific Insights

    Sep 30, 2026Jiayi Geng, Zhengxuan Wu, Kevin S. Chen +12Scientific DiscoveryLong-Horizon Agent Evaluation

  5. EngramBench: A Capability-Grounded Benchmark for Skill-Evolution Harnesses

    Sep 30, 2026Zhixuan Tan, Pengjie Gu, Zhao Li +4Software Engineering BenchmarksLong-Horizon Agent Evaluation

  6. When Harnesses Lose the Signal: Causal Evaluation of Recovery in LLM Agents

    Sep 30, 2026Shuyao Xiao, Shengling Wang, Xuan Chen +7Long-Horizon Agent EvaluationCausal Interventions in Language Models

  7. EnterpriseBench: Benchmarking LLM Agents on Enterprise-Level Strategic Reasoning and Decision-Making

    Sep 29, 2026Min Yang, Yichen Pan, Jinghua Piao +3AI-Assisted Decision MakingLLM Agent Evaluation

  8. LoLBench: Evaluating Coding Agents with Long-Horizon Proposals on Large Software Systems

    Sep 29, 2026Yun Peng, Zihan Wu, Zeyang Zhuang +6Software EngineeringAI Coding Agents

  9. Traverse: Learning When to Remember, Reset, and Redirect for Long-Horizon Web Search

    Sep 29, 2026Jingyuan Ma, Lynx Aster, He Zhang +5Long-Horizon Agent EvaluationWeb Search Agents

  10. PrecogUI: Proactive GUI Agents via Pre-cognitive Simulation and Experience Retrieval

    Sep 29, 2026Bin Kang, Jiarui Ouyang, Li Jiang +2GUI AgentsLong-Horizon Agent Evaluation

  11. StateTape: Action-Conditioned Evidence Lifecycle Modeling for Long-Horizon Coding Agents

    Sep 28, 2026Ziyang Yu, Liang Zhao, Bowen Zhu +1AI Coding AgentsLLM Agent Memory

  12. ARISE: Adapting to Evolving Capability Gaps in Agentic Reinforcement Learning

    Sep 28, 2026Kun Feng, Yuchen Fang, Yiyang Tan +6Agentic RLLong-Horizon Agent Evaluation

  13. Long-Horizon Scaling: How Model Capabilities Shape the Returns to Computation

    Sep 28, 2026Haoyu Zheng, Zhengyu Chen, Huaisheng Zhu +5Cost-Aware InferenceInference-Time Scaling

  14. PDEU-Bench: Benchmarking the Personalized Planning Lifecycle of Tool-Calling LLM Agents

    Sep 28, 2026Huayi Lai, Shichao Song, Qingchen Yu +4Long-Horizon Agent EvaluationAI Agent Benchmarks

  15. CEO Arena: Evaluating Long-Horizon Multi-Agent Decision-Making in Competitive Markets

    Sep 28, 2026An Yan, Yu Huo, Zhiwei Shang +2Game TheoryLLM Agent Evaluation

  16. LongPuzzleBench: Evaluating GUI Agents on Long-Horizon Visual Puzzles

    Sep 28, 2026Bingo Zhang, Haochuan Lu, Zongjie Li +3GUI AgentsLong-Horizon Agent Evaluation

  17. FromPitch2Board: Benchmarking LLM Agents in Long-Horizon Football Management

    Sep 28, 2026Peiyu ZangLong-Horizon Agent EvaluationAI Agent Benchmarks

  18. Opera: A Verbal Critic Framework for Long-horizon Coding Agents

    Sep 27, 2026Kai Mei, Zhiyuan Hu, Yutong Dai +7AI Coding AgentsAI Agent Auditing

  19. When Successful Strategies Fail: Adaptation to Environmental Novelty in Terminal Agents

    Sep 27, 2026Janvijay Singh, Vaishnavi Shrivastava, Dilek Hakkani-Tur +2Long-Horizon Agent EvaluationAI Agent Benchmarks

  20. EverMine: Dissecting the Self-Evolution of Research Capabilities in Long-Horizon Alpha Research

    Sep 27, 2026Siyuan Li, Jiangfeng Zhang, Rui Yao +3Quantitative FinanceLong-Horizon Agent Evaluation

  21. Adaptive Consistency Graph for Long-Horizon Agents

    Sep 26, 2026Jiecong Wang, Hao Peng, Zhanyi WangLong-Horizon Agent EvaluationGraph-Based Agent Memory

  22. The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks

    Sep 22, 2026Wenbo Pan, Zhichao Liu, Shujie Liu +6Software Engineering BenchmarksLong-Horizon Agent Evaluation

  23. GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay

    Sep 21, 2026Yiran Wang, Xingyilang Yin, Junfu Pu +12Game-Playing AgentsLong-Horizon Agent Evaluation

  24. DeliveryGym: An RL Environment for Long-Horizon Embodied Agent Planning with Adaptive Curriculum

    Sep 17, 2026Haoqiang Kang, Yiming Zhang, Yiyang Guo +5Long-Horizon PlanningLong-Horizon Agent Evaluation

  25. Reach or Solve? Attributing Agentic RL Gains with Checkpoint Handoffs

    Sep 17, 2026Xuan Liu, Jingbin QianAgentic RLLong-Horizon Agent Evaluation

  26. SIMLIFE: Pattern Understanding for Long-Horizon Human-Agent Partnership

    Sep 17, 2026Run Peng, Zinnia Nie, Jing Ding +7Human Behavior SimulationLong-Horizon Agent Evaluation

  27. Locating Hidden Failures Makes Long-Horizon Agents More Reliable

    Sep 15, 2026Salman Rahman, Yubin Kim, Mihir Parmar +15Agent Failure AnalysisAI Agent Reliability

  28. BLINDSPOT: A Benchmark for Safety and Refusal Calibration in Long-Horizon Tool-Using Agents

    Sep 14, 2026Sadia Asif, Mohammad Mohammadi Amiri, Momin Abbas +2Long-Horizon Agent EvaluationAI Agent Safety Benchmarks

  29. When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis

    Sep 14, 2026Kaiyuan Liu, Qiuyang Mang, Bo Peng +6LLM Agent EvaluationTest-Time Scaling

  30. MemRiskBench: Trace-Aware Risk-Preserving Evaluation for Long-Horizon LLM Agents

    Sep 14, 2026Jianhua Jiang, Dongbo Yuan, Weihua LiLong-Horizon Agent EvaluationAI Agent Safety Benchmarks

  31. DynSTEER: Dynamic Stage-wise Trajectory Evaluation and Execution-time Review for Agents

    Sep 13, 2026Zhichao Shi, Xuhui Jiang, Wenjie Zhang +5LLM Agent EvaluationAI Agent Evaluation

  32. Safety Signals to Verify NetOps Agents with Action-Level Granularity

    Sep 13, 2026Tobias Labarta, Frederik Pahde, Novak Boškov +5Long-Horizon Agent EvaluationAI Agent Safety

  33. T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

    Sep 12, 2026Junyao Yang, Yucheng Shi, Zhongzhi Li +4Terminal AgentsLong-Horizon Agent Evaluation

  34. JarvisGUI: Towards Cross-Device GUI Agents with Dynamic Task Composition

    Sep 9, 2026Zixiang Chen, Yuheng Lu, Zihao Cheng +8Computer-Use Agent BenchmarksGUI Agents

  35. EvoNav-Bench: Benchmarking Lifelong Navigation in Evolving Environments

    Sep 8, 2026Xilin Wang, Guoxi Zhang, Hongming Xu +3Embodied NavigationRobot Navigation

  36. Linguistic Trajectory Encoding for Efficient Long-Horizon Spatial Memory in Embodied Agents

    Sep 4, 2026Tianyidan Xie, Shenyi Wang, Qiang Tang +7Long-Horizon Agent EvaluationTrajectory Representation Learning

  37. Measuring the Behavioral Fidelity of Long-Horizon Human Activity Simulations

    Sep 1, 2026Yi Fei Cheng, Fan Yang, Iremsu Bas +3Human Behavior SimulationLong-Horizon Agent Evaluation

  38. Deploying and Evaluating a Smart-Agriculture Agentic Engine for Full-Season Soybean Farm Operations

    Aug 31, 2026Ao Qu, Panagiotis Michelakis, Linyuan Han +8Software EngineeringMulti-Agent Orchestration

  39. E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation

    Aug 31, 2026Wei Fan, Xinjie Shen, Xudong Guo +8Long-Horizon Agent EvaluationAI Agent Benchmarks

  40. ATLAS: Dual-Horizon Diagnostic Evaluation for Industrial Tool-Use Agents

    Aug 31, 2026Wei Chen, Peilun Zhou, Zhaoyu Hu +8Tool-Use EvaluationLLM Agent Evaluation

  41. UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City

    Aug 27, 2026Tianjie Ju, Zheng Wu, Yueqing Sun +15Spatial Reasoning BenchmarksRobot Navigation

  42. PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

    Aug 13, 2026Kaixin Ding, Xi Chen, Minghong Cai +9Long-Horizon Agent EvaluationWorld Model Evaluation