Computer-Use Agent Benchmarks

Latest papers 91

All topics
CardsList
  1. AgentHorizon: Evaluating Agentic Judges for Long-Horizon Computer-Use Tasks

    Oct 8, 2026Xing Han Lù, Dheeraj Vattikonda, Sina Hajimiri +7Computer-Use Agent BenchmarksLong-Horizon Agent Evaluation

  2. cua-speedrun: Standardized Benchmarking of the Speed of Computer-Use Agents

    Sep 30, 2026Pranjal Aggarwal, Lawrence Keunho Jang, Sean Welleck +3Computer-Use Agent BenchmarksBenchmark Design

  3. OSWorld-Science: A Benchmark of Computer Use Agents for Learning and Using Scientific Software

    Sep 30, 2026Dingyuan Dai, Heli Qi, Lei Liu +28Computer-Use Agent BenchmarksAI for Science

  4. ERPBench: A State-Grounded Evaluation Paradigm for Computer-Use Agents in Enterprise Software

    Sep 15, 2026Kratika Bhagtani, Kusha Sridhar, Maziyar Baran Pouyan +2Computer-Use Agent BenchmarksAI Agent Reliability

  5. JarvisGUI: Towards Cross-Device GUI Agents with Dynamic Task Composition

    Sep 9, 2026Zixiang Chen, Yuheng Lu, Zihao Cheng +8Computer-Use Agent BenchmarksGUI Agents

  6. FinCUABuild: Can Agents Build Reliable Benchmarks for Dynamic Financial Computer Use?

    Sep 7, 2026Jingpu Yang, Fengxian Ji, Jinri Guo +7Computer-Use Agent BenchmarksFinancial Services

  7. ElderBench: Benchmarking Autonomous Mobile Agents for Older Adults

    Sep 7, 2026Weide Zhan, Qumu Shaqu, Yuanqing Liu +6Mobile GUI AutomationComputer-Use Agent Benchmarks

  8. DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?

    Aug 11, 2026Mizanur Rahman, Mohammed Saidul Islam, Ridwan Mahbub +3Computer-Use Agent BenchmarksAI Agent Evaluation

  9. OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

    Jul 30, 2026Qiushi Sun, Kanzhi Cheng, Yian Wang +20VLM EvaluationComputer-Use Agent Benchmarks

  10. How Benchmarks Mis-Score Computer-Use Agents

    Jul 30, 2026Zihan Dong, Zhiyuan Ma, Zekun Wang +5Agent Failure AnalysisComputer-Use Agent Benchmarks

  11. Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale

    Jul 30, 2026Yash Pandya, Sahil Gupta, Sarthak Harne +10Computer-Use Agent BenchmarksComputer-Use Agents

  12. OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

    Jul 29, 2026Jingbo Zhou, Yusai Zhao, Qi Bao +12Computer-Use Agent BenchmarksComputer-Use Agents

  13. Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions?

    Jul 28, 2026Abhishek Pillai, Samir Kumar Nayak, Yuan ChenComputer-Use Agent BenchmarksComputer-Use Agents

  14. WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing

    Jul 28, 2026Hao Liang, Meiyi Qiang, Sizhe Qiu +2Computer-Use Agent BenchmarksAI Agent Benchmarks

  15. E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios

    Jul 26, 2026Weihuang Zheng, Tianyuan Zou, Eileen Ye +5Computer-Use Agent BenchmarksTool-Use Evaluation

  16. Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI

    Jul 24, 2026Jiaqi Shao, Hanck Chen, Wei Zhang +2Computer-Use Agent BenchmarksReward Hacking

  17. EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding

    Jul 19, 2026Yaohan Yang, Minglei Shi, Borui Zhang +2Computer-Use Agent BenchmarksGUI Agents

  18. Beyond Sequential Interaction: Benchmarking Parallel Execution and Coordination for GUI Agents

    Jul 17, 2026Zedong Yu, Qianxing Li, Zhi Gao +8Computer-Use Agent BenchmarksGUI Agents

  19. OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios

    Jul 16, 2026Chengyu Shen, Yujie Fu, Gangtao Xin +13Computer-Use Agent BenchmarksAI Agent Evaluation

  20. DevicesWorld: Benchmarking Cross-Device Agents in Heterogeneous Environments

    Jul 15, 2026Huatao Li, Xinwei Geng, Yuheng Wang +9Computer-Use Agent BenchmarksLLM Agent Evaluation

  21. DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers

    Jul 10, 2026Jerzy Kamiński, Ilya Galyukshev, Artem Kuznetsov +4Computer-Use Agent BenchmarksLLM Agent Evaluation

  22. AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation

    Jul 7, 2026Andrey Podivilov, Vadim Lomshakov, Sergey Savin +4Computer-Use Agent BenchmarksAI Coding Agents

  23. PHREEQC-MCQ-200: A Diagnostic Benchmark for Tool-Augmented Scientific Simulator Agents

    Jul 1, 2026Ke Zhang, Sahchit Chundur, Mohammad Javad Qomi +1Computer-Use Agent BenchmarksAI for Science