148 papers in the last four weeks, up 185% on the four weeks before. 1.5% of all new papers.
Sep 28, 2026·Bingo Zhang, Haochuan Lu, Zongjie Li +3GUI AgentsLong-Horizon Agent Evaluation
Vera Praxis · Tencent · The Hong Kong University of Science and Technology +2
Sep 28, 2026·Jie Yang, Jiajun Chen, Jiazheng Zhou +4Autonomous Driving BenchmarksAutonomous Driving
Fudan University · Shanghai Innovation Institute
Sep 28, 2026·Peiyu ZangLong-Horizon Agent EvaluationAI Agent Benchmarks
School of Mathematical Sciences, Beijing Normal University · CoRe Lab, Institute for Artificial Intelligence, Peking University
Sep 28, 2026·Cheuk Hang Lau, Zeyu Cao, Kevin Wong Cheuk Yin +6LLM Inference EfficiencyLLM Inference
Imperial College London · University of Cambridge · University of Oxford
Sep 28, 2026·Xiaoting Lyu, Xinbo Ma, Yufei Han +5AI Agent BenchmarksScientific Reasoning in Language Models
Xi’an Jiaotong University, China · Inria, France · Agency for Science, Technology and Research (A*STAR), Singapore +1
Sep 28, 2026·Yapeng Li, Songze Li, Shuang Yu +4Multi-Agent LLM SystemsMulti-Agent Collaboration
Harbin Institute of Technology, Harbin, China · Peking University, Beijing, China
Sep 28, 2026·Xijing Wang, Yinsheng Yao, Jinru Ding +5LLM Agent EvaluationAI Agent Benchmarks
Tongji University · Johns Hopkins University · Shanghai Artificial Intelligence Laboratory +3
Sep 28, 2026·Chanhee Park, Jeongho Yoon, Sungbin Han +2Multi-Hop QATool-Augmented Language Model Agents
Korea University · Sookmyung Women’s University
Sep 28, 2026·Zixuan Pan, Davide Panzeri, Lukas Johanns +5AI Agent ReliabilityAI Agent Evaluation
Department of Computer Science and Engineering, University of Notre Dame, Notre Dame, USA · Leibniz-Institut für Analytische Wissenschaften – ISAS – e.V., Dortmund, Germany · Institute of Computer Science, University of Tartu, Tartu, Estonia
Sep 28, 2026·Weijun Luo, Kelvin Luu, Xinyi Liu +6Reward HackingBenchmark Auditing
Scale AI
Sep 28, 2026·Jingyun Jia, Antoine Remond-Tiedrez, Aaron Alvarez +3LLM EvaluationAI Agent Benchmarks
University of Wisconsin–Madison, Intelligible · Intelligible · University of Cincinnati
Sep 28, 2026·Dong Xu, Zhangfan Yang, Jiantao Wu +5LLM Agent EvaluationAI Agent Benchmarks
School of Artificial Intelligence, Shenzhen University · EasternDawn · School of Computer Science, University of Nottingham Ningbo
Sep 28, 2026·Haitong Ma, Chenxiao Gao, Rushi Qiang +2AI Agent BenchmarksRobot Learning
Harvard University · Georgia Institute of Technology
Sep 28, 2026·Shane K. A. Dalumura Hettige, Jonas OppenlaenderCreativity AssessmentAgentic Image Generation
Computer Science and Engineering University of Oulu Oulu, Finland · Centre for Applied Computing University of Oulu Oulu, Finland
Sep 27, 2026·Yuwei Han, Lingwei Wei, Wooseong Yang +4Online Anomaly DetectionAI Agent Benchmarks
Sep 27, 2026·Janvijay Singh, Vaishnavi Shrivastava, Dilek Hakkani-Tur +2Long-Horizon Agent EvaluationAI Agent Benchmarks
University of Illinois Urbana-Champaign · Microsoft Research AI Frontiers
Sep 27, 2026·Eduardo Ariño de la Rubia, Szilard PafkaAI Coding AgentsLLM Agent Evaluation
Central European University · Epoch
Sep 27, 2026·Saeid Asgari, Emre Kiciman, Leonardo de Oliveira Nunes +1Language Model Generation EvaluationLong-Horizon Agent Evaluation
Microsoft
Sep 27, 2026·Yifan Liu, Praveen Venkateswaran, Abdulhamid Adebayo +1Gradient-Based AttributionAI Agent Benchmarks
University of Illinois Urbana-Champaign · IBM
Sep 27, 2026·Haochen Luo, Yifan Li, Binh Minh An +4Quantitative FinanceLLM Agent Evaluation
City University of Hong Kong · The Chinese University of Hong Kong (Shenzhen) · Shanghai University of Finance and Economics
Sep 27, 2026·Nan Huang, Mario Tapia-Pacheco, Kun Zhou +4AI Agent ReliabilityScientific Hypothesis Generation
University of California San Diego · Independent Researcher
Sep 27, 2026·Analog Design Bench TeamBenchmark DesignElectronic Design Automation
Sep 27, 2026·Dehai Min, Daoan Zhang, Yiming Zeng +13Benchmark ConstructionLLM Agent Evaluation
ByteDance Inc., USA · University of Illinois at Chicago
Sep 26, 2026·Nikita Mehrotra, Ashish Tiwari, Priyanshu Gupta +1Software Engineering AgentsLong-Horizon Agent Evaluation
Sep 24, 2026·Ming Zhang, Zhenghao Xiang, Peizhong Gao +17AI Agent EvaluationAI Agent Benchmarks
Fudan University · Hunyuan Team, Tencent
Sep 24, 2026·Benjamin Gruenbaum, Doron Porat, Assaf Natanzon +3Tool-Augmented Language Model AgentsLLM Agent Evaluation
Eon
Sep 24, 2026·Ivan MatveevAgent Harness OptimizationAI Agent Benchmarks
Proxima Ultra
Sep 23, 2026·Mithil Salunkhe, Haochen Ding, Samridhi Verma +1LLM Agent EvaluationAI Agent Benchmarks
University of Illinois Urbana-Champaign · National Center for Supercomputing Applications
Sep 23, 2026·Geng Chen, Ruotong Pan, Zhirui Yang +9AI Agent BenchmarksUser Simulation
Peking University · Kuaishou Technology · Xi’an Jiaotong University +3
Sep 23, 2026·Zhilong Ge, Yuting Shao, Yutao Yang +6Tool-Augmented Language Model AgentsLLM Agent Skill Learning
School of Computer Science and Technology, East China Normal University, Shanghai · Shanghai AI Laboratory