Agent Benchmarks

Momentum

9 papers in the last four weeks, up 50% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 87

All topics
CardsList
  1. Ask Now, Use Later: Benchmarking the Proactivity Gap in Long-Lived LLM Agents

    May 27, 2026Bin Wu, Guanyun Zou, Bingbing Wang +2LLM Agent MemoryLLM Agent Evaluation

  2. FastKernels: Benchmarking GPU Kernel Generation in Production

    May 22, 2026Gabriele Oliaro, Yichao Fu, May Jiang +5GPU Kernel OptimizationGPU Acceleration

  3. MemGym: a Long-Horizon Memory Environment for LLM Agents

    May 20, 2026Wujiang Xu, Yu Wang, Kai Mei +8LLM Agent MemoryLLM Agent Evaluation

  4. EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective

    May 18, 2026Yuyao Wang, Zhongjian Zhang, Mo Chi +7LLM Agent MemoryLLM Agent Evaluation

  5. SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory

    May 15, 2026Huacan Chai, Yukai Wang, Yingxuan Yang +7Multimodal MemoryMultimodal Reasoning

  6. ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents

    May 13, 2026Yuxiang Lai, Peng Xia, Haonian Ji +8Computer-Use Agent BenchmarksLLM Agent Evaluation

  7. FIKA-Bench: From Fine-grained Recognition to Fine-Grained Knowledge Acquisition

    May 13, 2026Geng Li, Yuxin PengVLM EvaluationFine-Grained Visual Perception

  8. MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare

    May 12, 2026Yihao Wang, Haoran Xu, Renjie Gu +10Agent MemoryHealthcare

  9. CodeClinic: Evaluating Automation of Coding Skills for Clinical Reasoning Agents

    May 10, 2026Timothy Ossowski, Xinchi Liu, Danyal Maqbool +6HealthcareLLM Agent Skill Learning

  10. ProactBench: Beyond What The User Asked For

    May 9, 2026Sepehr Harfi, Ahmad Salimi, Dongming Shen +1LLM Agent EvaluationProactive Assistance

  11. DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis

    May 4, 2026Qiaohong Zhang, Weihao Ye, Jialong Chen +7LLM Agent ReliabilityAgent Benchmarks

  12. ESARBench: A Benchmark for Agentic UAV Embodied Search and Rescue

    May 2, 2026Daoxuan Zhang, Ping Chen, Jianyi Zhou +1Aerial RoboticsRobotics Simulation

  13. EO-Gym: A Multimodal, Interactive Environment for Earth Observation Agents

    May 2, 2026Sai Ma, Zhuang Li, Sichao Li +4Spatiotemporal ReasoningRemote Sensing

  14. LATTICE: Evaluating Decision Support Utility of Crypto Agents

    Apr 29, 2026Aaron Chan, Tengfei Li, Tianyi Xiao +3AI-Assisted Decision MakingAI Agent Benchmarks

  15. DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios

    Apr 28, 2026Jinxiang Meng, Shaoping Huang, Fangyu Lei +17Data VisualizationAI Agent Benchmarks

  16. PersonalHomeBench: Evaluating Agents in Personalized Smart Homes

    Apr 18, 2026Manasa Bharadwaj, Yolanda Liu, InJung Yang +5AI Agent EvaluationMultimodal Agents

  17. GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows

    Apr 17, 2026Jize Wang, Xuanxuan Liu, Yining Li +7Tool-Use EvaluationLong-Horizon Agent Evaluation

  18. Two-Bridge: Exclusive Objectives and Extended Horizon StarCraft II Benchmark

    Feb 19, 2026Sourav Panda, Tanmay Ambadkar, Shreyash Kale +2RL BenchmarksGame-Playing Agents

  19. When Actions Go Off-Task: Detecting and Correcting Misaligned Actions in Computer-Use Agents

    Feb 9, 2026Yuting Ning, Jaylen Jones, Zhehao Zhang +5LLM Self-CorrectionComputer-Use Agents

  20. ProAct: A Benchmark and Multimodal Framework for Structure-Aware Proactive Response

    Feb 3, 2026Xiaomeng Zhu, Fengming Zhu, Weijie Zhou +8AI Agent BenchmarksProactive Assistance

  21. EvoHarnessBench: Can Your Agents Keep Pace with an Evolving Harness?

    Date pendingZixuan Ke, Vaidehi Patil, Haizhou Shi +9Continual Learning for LLM AgentsLLM Agent Harnesses