Long-Horizon Agent Evaluation

Momentum

47 papers in the last four weeks, up 176% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 232

All topics
CardsList
  1. EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments

    Jun 11, 2026Jundong Xu, Qingchuan Li, Jiaying Wu +11Benchmark DesignLong-Horizon Agent Evaluation

  2. Search Discipline for Long-Horizon Research Agents

    Jun 9, 2026Adithya Srinivasan, Devesh ParagiriAI-Assisted Scientific ResearchLong-Horizon Agent Evaluation

  3. SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks

    Jun 8, 2026Hongcheng Gao, Hailong Qu, Jingyi Tang +18Spatial Reasoning BenchmarksVisual Spatial Reasoning

  4. TRACE: Trajectory Reasoning through Adaptive Cross-Step Evidence Aggregation for LLM Agents

    Jun 5, 2026Vijitha Mittapalli, Shreyaa Jayant Dani, Satya Srujana Pilli +7Long-Horizon Agent EvaluationAI Agent Security

  5. SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?

    Jun 5, 2026Rishi Desai, Jesse Hu, Joan Cabezas +23AI Coding AgentsSoftware Engineering Benchmarks

  6. SubtleMemory: A Benchmark for Fine-Grained Relational Memory Discrimination in Long-Horizon AI Agents

    Jun 4, 2026Wenxuan Wang, Haoyu Sun, Fukuan Hou +4Persistent Memory for Language ModelsLong-Horizon Agent Evaluation

  7. Agents' Last Exam

    Jun 3, 2026Yiyou Sun, Xinyang Han, Weichen Zhang +307Computer-Use Agent BenchmarksLong-Horizon Agent Evaluation

  8. SentinelBench: A Benchmark for Long-Running Monitoring Agents

    Jun 3, 2026Matheus Kunzler Maldaner, Adam Fourney, Amanda Swearngin +5Computer-Use Agent BenchmarksWeb Agent Benchmarks

  9. AutoLab: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks?

    Jun 3, 2026Zhangchen Xu, Junda Chen, Yue Huang +16Long-Horizon Agent EvaluationAI Agent Benchmarks

  10. LifeSide: Benchmarking Agents as Lifelong Digital Companions

    Jun 3, 2026Yuqian Wu, Zhijie Deng, Wei Chen +8Long-Horizon Agent EvaluationAI Companions

  11. ClinEnv: An Interactive Multi-Stage Long Horizon EHR Environment for Agents

    Jun 1, 2026Yuxing Lu, Yushuhong Lin, Wenqi Shi +4Long-Horizon Agent EvaluationClinical Decision-Making

  12. RescueBench: Can Embodied Agents Save Lives in the Wild ?

    Jun 1, 2026Kui Wu, Beiyu Guo, Hao Chen +6Agent MemoryEmbodied Navigation

  13. Momento: Evaluating Persistent Memory and Reasoning with Multi-Session Agentic Conversations

    May 30, 2026Adril Putra Merin, David Anugraha, Ayu Purwarianti +1Agent MemoryTemporal Reasoning

  14. MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft

    May 29, 2026Tianjie Ju, Yueqing Sun, Zheng Wu +7Long-Horizon Agent EvaluationAI Agent Benchmarks

  15. LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis

    May 28, 2026Kewei Xu, Xiaoben Lu, Shuofei Qiao +4Long-Horizon Agent EvaluationLong-Horizon Agent Tasks

  16. WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction

    May 28, 2026Chengzhi Liu, Yuzhe Yang, Sophia Xiao Pu +14Multimodal MemoryLLM Agent Memory

  17. DynSess: Dynamic Session-Level Evaluation and Optimization Framework for Role-Playing Agents

    May 28, 2026Rongsheng Zhang, Jiji Tang, Junnan Ren +6Large Language Model-Based Role-Play SimulationLong-Horizon Agent Evaluation

  18. Verifiable Benchmarking of Long-Horizon Spatial Biology

    May 27, 2026Ian Diks, Harihara Muralidharan, Tim Proctor +1Spatial TranscriptomicsBenchmark Design

  19. AndroidDaily: A Verifiable Benchmark for Mobile GUI Agents on Real-World Closed-Source Applications

    May 26, 2026Yifan Sui, Xin Huang, Hongbing Li +14Mobile GUI AutomationComputer-Use Agent Benchmarks

  20. Benchmarks are Not Enough: RAMP for Runtime Assessing of Agentic Models in Production Systems

    May 26, 2026Yipeng Ouyang, Xin Huang, Bingjie Liu +3Software Engineering AgentsLLM Agent Evaluation

  21. VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions

    May 26, 2026Yuxin Chen, Yi Zhang, Zhengzhou Cai +11LLM Agent MemoryAI Agent Evaluation