AI Agent Benchmarks

Momentum

146 papers in the last four weeks, up 161% on the four weeks before. 1.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 1,013

All topics
CardsList
  1. TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning

    May 31, 2026Yaxuan Kong, Qingren Yao, Yuqi Nie +7Time Series ReasoningLLM Agent Evaluation

  2. Recognize Your Orchestrator: An Entropy Dynamics Perspective for LLM Multi-Agent Systems

    May 31, 2026Junze Zhu, Weihao Chen, Xuanwang Zhang +2Multi-Agent LLM SystemsLLM Agent Orchestration

  3. HomeFlow: A Data Flywheel for Smart Home Agent Training with Verifiable Simulation

    May 31, 2026Yi Gu, Huacan Wang, Shuo Zhang +10AI Agent BenchmarksLLM Agent Training

  4. TravelEval: A Comprehensive Benchmarking Framework for Evaluating LLM-Powered Travel Planning Agents

    May 31, 2026Weiyi Chen, Shuaixiong Wang, Ziyun Gao +5Spatiotemporal ReasoningLLM Agent Evaluation

  5. FVSpec: Real-World Property-Based Tests as Lean Challenges

    May 31, 2026Quinn Dougherty, Max von Hippel, Simon Henniger +2Automated Software TestingAutomated Theorem Proving

  6. Momento: Evaluating Persistent Memory and Reasoning with Multi-Session Agentic Conversations

    May 30, 2026Adril Putra Merin, David Anugraha, Ayu Purwarianti +1Agent MemoryTemporal Reasoning

  7. SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory

    May 30, 2026Samiul Alam, Shakhrul Iman Siam, Michael J. Proulx +4Multimodal MemoryEgocentric Video QA

  8. I-WebGenBench : Evaluating Interactivity in LLM-Generated Scientific Web Applications

    May 30, 2026Dasen Dai, Biao Wu, Meng Fang +2AI for ScienceWeb Application Generation

  9. ForeSci: Evaluating LLM Agents for Forward-Looking AI Research Judgment

    May 30, 2026Qiuyu Tian, Haojie Yin, Yingce Xia +2LLM Agent EvaluationAI Agent Benchmarks

  10. Sandboxed Coding Agents are Competitive Omni-modal Task Solvers

    May 30, 2026Dongping Chen, Xuanao Huang, Zhihan Hu +3Audio-Visual UnderstandingAI Coding Agents

  11. BAGEN: Are LLM Agents Budget-Aware?

    May 29, 2026Yuxiang Lin, Zihan Wang, Mengyang Liu +9LLM Agent EvaluationAI Agent Benchmarks

  12. SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence

    May 29, 2026Yulu Pan, Han Yi, Seongsu Ha +4Sports Video AnalysisAI Agent Benchmarks

  13. PithTrain: A Compact and Agent-Native MoE Training System

    May 29, 2026Ruihang Lai, Hao Kang, Haozhan Tang +6Mixture-of-Experts Language ModelsEfficient Language Model Training

  14. Skill Availability and Presentation Granularity in Large-Language-Model Agents: A Controlled SkillsBench Study

    May 29, 2026Xiaonan Xu, Wenjing WuLLM Agent EvaluationLLM Agent Skill Learning

  15. TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories

    May 29, 2026Junjie Nian, Kang Chen, Ge Zhang +2Agent ReliabilitySoftware Engineering Benchmarks

  16. TadA-Bench: A Million-Variant Benchmark for Future-Round Discovery Toward Agentic Protein Engineering

    May 29, 2026Jin Gao, Juntu Zhao, Zirui Zeng +5Protein Fitness PredictionBenchmark Design

  17. MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft

    May 29, 2026Tianjie Ju, Yueqing Sun, Zheng Wu +7Long-Horizon Agent EvaluationAI Agent Benchmarks

  18. BlueFin: Benchmarking LLM Agents on Financial Spreadsheets

    May 29, 2026Srivatsa Kundurthy, Clara Na, Colton Moraine +6LLM Agent EvaluationAI Agent Benchmarks

  19. MAVEN: Improving Generalization in Agentic Tool Calling

    May 29, 2026Omkar Ghugarkar, Vishvesh Bhat, Muhammad Ahmed Mohsin +1Logical ReasoningLLM Agent Evaluation

  20. SoundnessBench: Can Your AI Scientist Really Tell Good Research Ideas from Bad Ones?

    May 28, 2026Sy-Tuyen Ho, Minghui Liu, Huy Nghiem +1AI for ScienceLLM Evaluation

  21. Specialize Roles, Mix Deployments: Pushing the Cost-Accuracy Frontier of LLM Agent Teams

    May 28, 2026Yinsicheng Jiang, Liang Cheng, Yeqi Huang +6Multi-Agent LLM SystemsLLM Agent Evaluation

  22. HEART-Bench: Do LLM Agents Exhibit Human-like Psychology?

    May 28, 2026Weihan Peng, Chenxu Zhang, Qianao Wang +7Personality Modeling in Language ModelsHuman Behavior Simulation

  23. Evolutionary Dynamics of Cooperation in Next-Generation LLM Agent Systems: A Cross-Provider Empirical Extension

    May 28, 2026Francisco León Zúñiga BolívarMulti-Agent LLM SystemsLLM Agent Evaluation

  24. PTCG-Bench: Can LLM Agents Master Pokémon Trading Card Game?

    May 28, 2026Dongdong Hua, Yifei Sun, Renhong Huang +3Game-Playing AgentsLLM Agent Evaluation