Software Engineering Benchmarks

Latest papers 89

All topics
CardsList
  1. SpecBench: Evaluating Specification-Level Reasoning for Software Engineering LLM Agents

    May 28, 2026Grant Hamblin, Kevin Song, Zhanda Zhu +4Requirements EngineeringSoftware Engineering Agents

  2. Automated Benchmark Auditing for AI Agents and Large Language Models

    May 25, 2026Junlin Wang, Federico Bianchi, Shang Zhu +4LLM EvaluationBenchmark Auditing

  3. RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations

    May 25, 2026Hanyu Li, Yichi Zhang, Speed Zhu +3AI Coding AgentsSoftware Engineering Benchmarks

  4. EvoCode-Bench: Evaluating Coding Agents in Multi-Turn Iterative Interactions

    May 22, 2026Haiyang Shen, Xuanzhong Chen, Wendong Xu +3AI Coding AgentsSoftware Engineering Benchmarks

  5. SWE-Mutation: Can LLMs Generate Reliable Test Suites in Software Engineering?

    May 21, 2026Yuxuan Sun, Yuze Zhao, Yufeng Wang +6LLM EvaluationAutomated Software Testing

  6. WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games

    May 17, 2026Wenyu Zhang, Guoliang You, Tianlun +8Web Application GenerationAI Coding Agents

  7. SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering

    May 17, 2026Qingnan Ren, Shun Zou, Shiting Huang +11Software EngineeringAI Coding Agents

  8. RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

    May 15, 2026Xinbo Xu, Ruihan Yang, Haiyang Shen +13AI Coding AgentsSoftware Engineering Benchmarks

  9. SWE-Chain: Benchmarking Coding Agents on Chained Release-Level Package Upgrades

    May 14, 2026Man Ho Lam, Chaozheng Wang, Hange Liu +5Software Engineering AgentsSoftware Engineering Benchmarks

  10. Code-Centric Detection of Vulnerability-Fixing Commits: A Unified Benchmark and Empirical Study

    May 13, 2026Nils Loose, Joseph Bienhüls, Kristoffer Hempel +2Software Vulnerability DetectionSoftware Engineering Benchmarks

  11. AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation

    May 13, 2026Priyam Sahoo, Gaurav Mittal, Xiaomin Li +4Agent Failure AnalysisSoftware Engineering Agents

  12. Counterfactual Trace Auditing of LLM Agent Skills

    May 12, 2026Xiaolin Zhou, Jinbo Liu, Li Li +2Software Engineering AgentsSoftware Engineering Benchmarks

  13. An Executable Benchmarking Suite for Tool-Using Agents

    May 10, 2026Zhiqing Zhong, Zhijing Ye, Jiamin Wang +1Computer-Use Agent BenchmarksTool-Use Evaluation

  14. SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution

    May 8, 2026Mohit Raghavendra, Soham Dan, Miguel Romero Calvo +12Coding AgentsSoftware Engineering Benchmarks

  15. ProgramBench: Can Language Models Rebuild Programs From Scratch?

    May 5, 2026John Yang, Kilian Lieret, Jeffrey Ma +9Software Engineering AgentsSoftware Engineering Benchmarks

  16. SWE-QA: A Dataset and Benchmark for Complex Code Understanding

    Apr 27, 2026Laïla Elkoussy, Julien PerezLLM EvaluationSoftware Engineering Benchmarks

  17. Deja Vu at Scale: Paraphrase-Robust Detection of Duplicate Gherkin Steps in Behaviour-Driven Software Testing with Sentence-Transformer Embeddings and a 1.1M-Step Open Benchmark

    Apr 22, 2026Ali Hassaan Mughal, Noor Fatima, Muhammad BilalAutomated Software TestingBenchmark Construction

  18. Neurosymbolic Repo-level Code Localization

    Apr 17, 2026Xiufeng Xu, Xiufeng Wu, Zejun Zhang +1Software Engineering BenchmarksLLM-Based Program Synthesis

  19. SWE-Universe: Scale Real-World Verifiable Environments to Millions

    Feb 2, 2026Mouxiang Chen, Lei Zhang, Yunlong Feng +16Software EngineeringBenchmark Construction

  20. SpIDER: Spatially Informed Dense Embedding Retrieval for Software Issue Localization

    Dec 18, 2025Shravan Chaudhari, Rahul Thomas Jacob, Jiajun Cao +3Software EngineeringSoftware Engineering Benchmarks

  21. SWE-fficiency: Can Language Models Optimize Real-World Repositories on Real Workloads?

    Nov 8, 2025Jeffrey Jian Ma, Milad Hashemi, Amir Yazdanbakhsh +5Software Engineering AgentsBenchmark Design

  22. BuildBench: Benchmarking LLM Agents on Compiling Real-World Open-Source Software

    Sep 27, 2025Zehua Zhang, Ati Priya Bajaj, Divij Handa +14Software Engineering AgentsSoftware Engineering Benchmarks

  23. FullFront: Benchmarking MLLMs Across the Full Front-End Engineering Workflow

    May 23, 2025Haoyu Sun, Huichen Will Wang, Jiawei Gu +2Software EngineeringWeb Application Generation

  24. SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents

    Date pendingBingchen Zhao, Dhruv Srikanth, Yuxiang Wu +1Reward HackingAI Coding Agents