Computer-Use Agent Benchmarks

Latest papers 91

All topics
CardsList
  1. TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents

    Jun 26, 2026Shoufa Chen, Luyuan Wang, Xuan Yang +7Computer-Use Agent BenchmarksComputer-Use Agents

  2. Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets

    Jun 24, 2026Divake Kumar, Sina Tayebati, Devashri Naik +5Computer-Use Agent BenchmarksUncertainty Quantification

  3. EvoClawBench: Can Agents Learn Reusable Skills from Their Own Runs?

    Jun 23, 2026Zhiyuan Peng, Xin Yin, Chenhao Ying +5Computer-Use Agent BenchmarksLLM Agent Self-Improvement

  4. ENVS: Environment-Native Verified Search for Long-Horizon GUI Agents

    Jun 22, 2026Yincheng Zhou, Athena Zhuoming Zhong, Shijie Zhang +3Distribution Shift RobustnessComputer-Use Agent Benchmarks

  5. MacAgentBench: Benchmarking AI Agents on Real-World macOS Desktop

    Jun 21, 2026Yikun Fu, Bowen Fu, Zhenyu Wu +10Computer-Use Agent BenchmarksComputer-Use Agents

  6. ChainWorld: Composing Long-Horizon Desktop Workloads from Atomic OSWorld Tasks

    Jun 19, 2026Vincent Siu, Manasi Sharma, Dawn Song +2Computer-Use Agent BenchmarksComputer-Use Agents

  7. LabOSBench: Benchmarking Computer Use Agents for Scientific Instrument Control

    Jun 15, 2026Anqi Zou, Han Deng, Chengyu Zhang +9Computer-Use Agent BenchmarksComputer-Use Agents

  8. MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents

    Jun 15, 2026Lawrence Keunho Jang, Andrew Keunwoo Jang, Jing Yu Koh +1Computer-Use Agent BenchmarksTool-Augmented Language Model Agents

  9. STAGE-Claw: Automated State-based Agent Benchmarking for Realistic Scenarios

    Jun 9, 2026Sirui Liang, Bohan Yu, Peiyu Wang +8Computer-Use Agent BenchmarksLLM Agent Evaluation

  10. iOSWorld: A Benchmark for Personally Intelligent Phone Agents

    Jun 8, 2026Lawrence Keunho Jang, Mareks Woodside, Geronimo Carom +3Computer-Use Agent BenchmarksComputer-Use Agents

  11. MacArena: Benchmarking Computer Use Agents on an Online macOS Environment

    Jun 4, 2026Victor Muryn, Maksym Shamrai, Sofiia Mazepa +1Computer-Use Agent BenchmarksComputer-Use Agents

  12. Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement

    Jun 4, 2026Xin Wang, Liangtai Sun, Yaoming Zhu +8Computer-Use Agent BenchmarksLanguage Model Generation Evaluation

  13. Agents' Last Exam

    Jun 3, 2026Yiyou Sun, Xinyang Han, Weichen Zhang +307Computer-Use Agent BenchmarksLong-Horizon Agent Evaluation

  14. SentinelBench: A Benchmark for Long-Running Monitoring Agents

    Jun 3, 2026Matheus Kunzler Maldaner, Adam Fourney, Amanda Swearngin +5Computer-Use Agent BenchmarksWeb Agent Benchmarks

  15. RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions

    Jun 2, 2026Zongwei Lv, Zhewen Tan, Yaoming Li +7Computer-Use Agent BenchmarksAI Coding Agents

  16. MedCUA-Bench: A Screenshot-Only Benchmark for Clinical Computer-Use Agents

    Jun 2, 2026Jia Yu, Zilong Wang, Xinyang Jiang +2Computer-Use Agent BenchmarksComputer-Use Agents

  17. DeskCraft: Benchmarking Desktop Agents on Professional Workflows and Human-in-the-Loop Collaboration

    Jun 2, 2026Wenkai Wang, Tao Xiong, Jingchen Ni +6Computer-Use Agent BenchmarksGUI Agents

  18. K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts

    Jun 1, 2026Nahyun Lee, Dongkeun Yoon, Guijin Son +12Computer-Use Agent BenchmarksLLM Evaluation

  19. GTA: Generating Long-Horizon Tasks for Web Agents at Scale

    May 28, 2026Tenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey +4Computer-Use Agent BenchmarksWeb Agent Benchmarks

  20. LiveBrowseComp: Are Search Agents Searching, or Just Verifying What They Already Know?

    May 27, 2026HuiMing Fan, Xiao Wang, Zheng Chu +5Computer-Use Agent BenchmarksLLM Agent Evaluation

  21. A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks

    May 27, 2026Tomer Keren, Nitay Calderon, Asaf Yehudai +3Computer-Use Agent BenchmarksTool-Use Evaluation

  22. AndroidDaily: A Verifiable Benchmark for Mobile GUI Agents on Real-World Closed-Source Applications

    May 26, 2026Yifan Sui, Xin Huang, Hongbing Li +14Mobile GUI AutomationComputer-Use Agent Benchmarks