Long-Horizon Agent Evaluation

Momentum

47 papers in the last four weeks, up 176% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 232

All topics
CardsList
  1. UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City

    Aug 27, 2026Tianjie Ju, Zheng Wu, Yueqing Sun +15Spatial Reasoning BenchmarksRobot Navigation

  2. PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

    Aug 13, 2026Kaixin Ding, Xi Chen, Minghong Cai +9Long-Horizon Agent EvaluationWorld Model Evaluation

  3. Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

    Aug 13, 2026Yiwei Li, Wanli Yang, Hexiang Tan +10Long-Horizon Agent EvaluationAgent Harness Optimization

  4. Beyond Retrieval: Query-Conditioned Reuse of Long-Horizon Agent Trajectories

    Aug 13, 2026Yifei Li, Heng Wang, Lingling Zhang +5Agent MemoryLong-Horizon Agent Evaluation

  5. Governed Persistent Memory: Source-Bound State Semantics and Fail-Closed Release for Long-Horizon Agents

    Aug 12, 2026Guodong XuAgent MemoryLong-Horizon Agent Evaluation

  6. Evo-Bench: Can Language Models Improve Agent Harness?

    Aug 10, 2026Lisheng Huang, Chen Yang, Hao Zhou +6AI Agent EvaluationLong-Horizon Agent Evaluation

  7. Action- and Language-Conditioned Video Assessment for Embodied Control

    Aug 8, 2026Hwanhee Kim, Jaehyun Jang, Seungmin Cha +3Video-Language Model EvaluationLong-Horizon Agent Evaluation

  8. Compiling and Benchmarking Task-State Horizons for Embodied Agents

    Aug 8, 2026Meiqi Wang, Shichao LiLong-Horizon Agent EvaluationRobot Task Planning

  9. TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories

    Aug 6, 2026Yunjia Qi, Zehua Yin, Xintong Shi +10Agent Failure AnalysisLong-Horizon Agent Evaluation

  10. FinEvo-Bench: A Longitudinal Benchmark for Self-Evolving Agents in Professional Financial Workflows

    Aug 6, 2026Bo Deng, Kang Zhou, Lifan Guo +6Long-Horizon Agent EvaluationAI Agent Benchmarks

  11. SkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution

    Aug 6, 2026Zhi Han, Chenxi Zeng, Liuhaichen Yang +3LLM-as-a-JudgeLong-Horizon Agent Evaluation

  12. SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents

    Aug 5, 2026Zhixiang Liang, Yifei Liu, Yidan Huang +5Agent Failure AnalysisAI Agent Reliability

  13. OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents

    Aug 4, 2026Jingsheng Zheng, Xinyuan Fang, Jintian Zhang +3LLM Agent MemoryLong-Horizon Agent Evaluation

  14. EduClaw-Bench: A Long-Horizon Benchmark for Pedagogical LLM Agents with Simulated Learners

    Aug 4, 2026Unggi Lee, Sookbun Lee, Yeil Jeong +3Intelligent Tutoring SystemsAI in Education

  15. Diagnosing Search Behavior and Failure Modes in Long-Horizon Search Agents

    Aug 3, 2026Qi Liu, Jiaxin Mao, Fengbin Zhu +1Deep Research AgentsLong-Horizon Agent Evaluation

  16. Long-Horizon Embodied Decision-Making via Multimodal Memory Compression

    Aug 2, 2026Bingxuan Li, Rui Yang, Cheng Qian +6Long-Horizon Agent EvaluationAI Agent Benchmarks

  17. ShiJianBench: From Dialogue to Decision for Long-Horizon Evaluation of Investment Advisors

    Aug 2, 2026Jie Gong, Maowei Jiang, Zhiwei Liu +14Financial ServicesLong-Horizon Agent Evaluation

  18. OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

    Aug 1, 2026Yunhao Chen, Xin Wang, Yixu Wang +6Adversarial AttacksLong-Horizon Agent Evaluation

  19. LoopsBench: From Harness Engineering to Loop Engineering in Coding Agent Evaluation

    Jul 31, 2026Han Li, Zhemin Fang, Rili Feng +8AI Coding AgentsSoftware Engineering Benchmarks