Long-Horizon Agent Evaluation

Momentum

47 papers in the last four weeks, up 176% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 232

All topics
CardsList
  1. EverMine: Dissecting the Self-Evolution of Research Capabilities in Long-Horizon Alpha Research

    Sep 27, 2026Siyuan Li, Jiangfeng Zhang, Rui Yao +3Quantitative FinanceLong-Horizon Agent Evaluation

  2. Adaptive Consistency Graph for Long-Horizon Agents

    Sep 26, 2026Jiecong Wang, Hao Peng, Zhanyi WangLong-Horizon Agent EvaluationGraph-Based Agent Memory

  3. The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks

    Sep 22, 2026Wenbo Pan, Zhichao Liu, Shujie Liu +6Software Engineering BenchmarksLong-Horizon Agent Evaluation

  4. GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay

    Sep 21, 2026Yiran Wang, Xingyilang Yin, Junfu Pu +12Game-Playing AgentsLong-Horizon Agent Evaluation

  5. DeliveryGym: An RL Environment for Long-Horizon Embodied Agent Planning with Adaptive Curriculum

    Sep 17, 2026Haoqiang Kang, Yiming Zhang, Yiyang Guo +5Long-Horizon PlanningLong-Horizon Agent Evaluation

  6. Reach or Solve? Attributing Agentic RL Gains with Checkpoint Handoffs

    Sep 17, 2026Xuan Liu, Jingbin QianAgentic RLLong-Horizon Agent Evaluation

  7. SIMLIFE: Pattern Understanding for Long-Horizon Human-Agent Partnership

    Sep 17, 2026Run Peng, Zinnia Nie, Jing Ding +7Human Behavior SimulationLong-Horizon Agent Evaluation

  8. Locating Hidden Failures Makes Long-Horizon Agents More Reliable

    Sep 15, 2026Salman Rahman, Yubin Kim, Mihir Parmar +15Agent Failure AnalysisAI Agent Reliability

  9. BLINDSPOT: A Benchmark for Safety and Refusal Calibration in Long-Horizon Tool-Using Agents

    Sep 14, 2026Sadia Asif, Mohammad Mohammadi Amiri, Momin Abbas +2Long-Horizon Agent EvaluationAI Agent Safety Benchmarks

  10. When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis

    Sep 14, 2026Kaiyuan Liu, Qiuyang Mang, Bo Peng +6LLM Agent EvaluationTest-Time Scaling

  11. MemRiskBench: Trace-Aware Risk-Preserving Evaluation for Long-Horizon LLM Agents

    Sep 14, 2026Jianhua Jiang, Dongbo Yuan, Weihua LiLong-Horizon Agent EvaluationAI Agent Safety Benchmarks

  12. DynSTEER: Dynamic Stage-wise Trajectory Evaluation and Execution-time Review for Agents

    Sep 13, 2026Zhichao Shi, Xuhui Jiang, Wenjie Zhang +5LLM Agent EvaluationAI Agent Evaluation

  13. Safety Signals to Verify NetOps Agents with Action-Level Granularity

    Sep 13, 2026Tobias Labarta, Frederik Pahde, Novak Boškov +5Long-Horizon Agent EvaluationAI Agent Safety

  14. T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

    Sep 12, 2026Junyao Yang, Yucheng Shi, Zhongzhi Li +4Terminal AgentsLong-Horizon Agent Evaluation

  15. JarvisGUI: Towards Cross-Device GUI Agents with Dynamic Task Composition

    Sep 9, 2026Zixiang Chen, Yuheng Lu, Zihao Cheng +8Computer-Use Agent BenchmarksGUI Agents

  16. EvoNav-Bench: Benchmarking Lifelong Navigation in Evolving Environments

    Sep 8, 2026Xilin Wang, Guoxi Zhang, Hongming Xu +3Embodied NavigationRobot Navigation

  17. Linguistic Trajectory Encoding for Efficient Long-Horizon Spatial Memory in Embodied Agents

    Sep 4, 2026Tianyidan Xie, Shenyi Wang, Qiang Tang +7Long-Horizon Agent EvaluationTrajectory Representation Learning

  18. Measuring the Behavioral Fidelity of Long-Horizon Human Activity Simulations

    Sep 1, 2026Yi Fei Cheng, Fan Yang, Iremsu Bas +3Human Behavior SimulationLong-Horizon Agent Evaluation

  19. Deploying and Evaluating a Smart-Agriculture Agentic Engine for Full-Season Soybean Farm Operations

    Aug 31, 2026Ao Qu, Panagiotis Michelakis, Linyuan Han +8Software EngineeringMulti-Agent Orchestration

  20. E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation

    Aug 31, 2026Wei Fan, Xinjie Shen, Xudong Guo +8Long-Horizon Agent EvaluationAI Agent Benchmarks

  21. ATLAS: Dual-Horizon Diagnostic Evaluation for Industrial Tool-Use Agents

    Aug 31, 2026Wei Chen, Peilun Zhou, Zhaoyu Hu +8Tool-Use EvaluationLLM Agent Evaluation