Long-Horizon Agent Evaluation

Momentum

47 papers in the last four weeks, up 176% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 232

All topics
CardsList
  1. Cross-Benchmark Generalization in Long-Horizon Agents

    Jul 31, 2026Sushant Mehta, Logan Ritchie, Liudas Panavas +1Long-Horizon Agent EvaluationRL Post-Training

  2. MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

    Jul 31, 2026Qiming Shi, Yulong Tao, Linbo Jin +10LLM Agent EvaluationLong-Horizon Agent Evaluation

  3. SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

    Jul 25, 2026Yang Wan, Zhenhao Zhang, Jierui Wang +1Reward ModelingLLM-as-a-Judge

  4. MEMENTO: Memory-Guided Memetic Code-as-Policy Evolution

    Jul 24, 2026Alkis Sygkounas, Victor Aregbede, Amy Loutfi +1Metaheuristic OptimizationLarge Language Model-Guided Optimization

  5. Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents

    Jul 24, 2026Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt +5Zero-Shot LearningMultimodal Large Language Models

  6. DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations

    Jul 22, 2026Jiazhen Jiang, Boxi Cao, Lingyong Yan +6Long-Horizon Agent EvaluationAI Agent Benchmarks

  7. EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World

    Jul 19, 2026Qing Zong, Yue Guo, Mengxin Yang +2Long-Horizon Agent EvaluationLLM Agents

  8. CLOSER-Bench: Evaluating Budgeted Cross-Stage Design Closure for Hardware Agents

    Jul 18, 2026Peilong Zhou, Zhirong Chen, Cangyuan Li +4Benchmark DesignElectronic Design Automation

  9. MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations

    Jul 14, 2026Xixuan Hao, Zeyu Zhang, Zehao Lin +6Conversational MemoryPersistent Memory for Language Models

  10. The Compliance Trap: Diagnosing How AI Agents Consume Conflicting Memory

    Jul 12, 2026Yixiong Chen, Xinyi Bai, Alan YuilleWeb Agent BenchmarksLong-Horizon Agent Evaluation

  11. DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers

    Jul 10, 2026Jerzy Kamiński, Ilya Galyukshev, Artem Kuznetsov +4Computer-Use Agent BenchmarksLLM Agent Evaluation

  12. LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making

    Jul 10, 2026Zihan Xu, Yanzhen Chen, Xiaocheng Zhang +4Long-Horizon Agent EvaluationClinical Decision-Making

  13. Scoped Verification for Reliable Long-Horizon Agentic Context Evolution under Distribution Shift

    Jul 10, 2026Dan C. Hsu, Luke LuAI Agent ReliabilityLong-Horizon Agent Evaluation

  14. Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

    Jul 9, 2026Zongxia Li, Zhongzhi Li, Yucheng Shi +10Long-Horizon Agent EvaluationAI Agent Benchmarks

  15. PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents

    Jul 7, 2026Hongliang Li, Yijin Liu, Zhiwei Zhang +5Multilingual Language Model EvaluationLong-Horizon Agent Evaluation

  16. Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents

    Jul 5, 2026Haiwen Yi, Xinyuan SongSoftware Engineering AgentsLLM Agent Evaluation

  17. LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

    Jul 4, 2026Rufeng Chen, Yue Chang, Zili Shao +4Embodied NavigationLong-Horizon Agent Evaluation