Long-Horizon Agent Evaluation

Momentum

47 papers in the last four weeks, up 176% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 232

All topics
CardsList
  1. AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents

    Jul 2, 2026Xiangchen Cheng, Yunwei Jiang, Jianwen Sun +7LLM Agent MemoryLong-Horizon Agent Evaluation

  2. QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents

    Jun 30, 2026Sergio Hernández-Gutiérrez, Matteo Merler, Ilze Amanda Auzina +3Long-Horizon Agent EvaluationAI Agent Benchmarks

  3. World-Model Collapse as a Phase Transition

    Jun 30, 2026Xinyuan Song, Zekun CaiPhase TransitionsModel Collapse

  4. AhaBench: Do Agents Turn Experience into Reusable Insights? A Long-Horizon Benchmark for Continual Learning

    Jun 30, 2026Zerui Cheng, Jiawei Xu, Huacan Chai +3Continual Learning for LLM AgentsLifelong Learning Agents

  5. SidConArena: An Environment Evaluating Agents in Open-Ended,Positive-Sum Bargaining Game

    Jun 24, 2026Yeqi Feng, Yuxin Chen, Tianxing HeMulti-Agent NegotiationGame Theory

  6. Long-Term Simulation Exposes Cognitive-Developmental Risks in AI Companions

    Jun 24, 2026Kaicheng Shen, Lingyu Li, Wen Wu +3Language Model Safety EvaluationLong-Horizon Agent Evaluation

  7. World Models in Pieces: Structural Certification for General Agents

    Jun 23, 2026Yikai Lu, Yifei Wu, Xinyu Lu +1Long-Horizon Agent EvaluationModel-Based Planning

  8. SAFARI: Scaling Long Horizon Agentic Fault Attribution via Active Investigation

    Jun 23, 2026Chenyang Zhu, Jiayu Yao, Kushal Chawla +10Agent Failure AnalysisLong-Horizon Agent Evaluation

  9. ENVS: Environment-Native Verified Search for Long-Horizon GUI Agents

    Jun 22, 2026Yincheng Zhou, Athena Zhuoming Zhong, Shijie Zhang +3Distribution Shift RobustnessComputer-Use Agent Benchmarks

  10. DynamicMem: A Long-Horizon Memory Benchmark in Real-World Settings

    Jun 22, 2026Wenya Xie, Shengming Zhou, Zelin Li +9Agent MemoryLLM Agent Memory

  11. MacAgentBench: Benchmarking AI Agents on Real-World macOS Desktop

    Jun 21, 2026Yikun Fu, Bowen Fu, Zhenyu Wu +10Computer-Use Agent BenchmarksComputer-Use Agents

  12. ChainWorld: Composing Long-Horizon Desktop Workloads from Atomic OSWorld Tasks

    Jun 19, 2026Vincent Siu, Manasi Sharma, Dawn Song +2Computer-Use Agent BenchmarksComputer-Use Agents

  13. WorldLines: Benchmarking and Modeling Long-Horizon Stateful Embodied Agents

    Jun 17, 2026Yehang Zhang, Jianchong Su, Haojian Huang +7Embodied QALong-Horizon Agent Evaluation

  14. CEO-Bench: Can Agents Play the Long Game?

    Jun 16, 2026Haozhe Chen, Karthik Narasimhan, Zhuang LiuLong-Horizon Agent EvaluationAI Agent Benchmarks

  15. When Web Agents Finish but Still Fail: Reproducible Triggers and Trace Diagnostics for Parallel Web Exploration

    Jun 16, 2026Aagam Sogani, Botao Rui, Swetha Vaidyanathan +3Agent Failure AnalysisWeb Agent Benchmarks

  16. SidewalkBench: Benchmarking Visual Navigation on Urban Sidewalks

    Jun 15, 2026Zhizheng Liu, Honglin He, Vivek Alumootil +4Visual NavigationLong-Horizon Agent Evaluation

  17. LabOSBench: Benchmarking Computer Use Agents for Scientific Instrument Control

    Jun 15, 2026Anqi Zou, Han Deng, Chengyu Zhang +9Computer-Use Agent BenchmarksComputer-Use Agents