Software Engineering Benchmarks

Latest papers 89

All topics
CardsList
  1. SWE-NFI: Studying and Benchmarking Coding Agents for Non-Functional Improvements

    Jul 29, 2026Pengyu Xue, He Yang Yuan, Xin Wang +6Software EngineeringCoding Agents

  2. ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders

    Jul 23, 2026Zhongyuan Peng, Dan Huang, Chuyu Zhang +8Coding AgentsSoftware Engineering Benchmarks

  3. Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

    Jul 23, 2026Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen +35Benchmark ContaminationSoftware Engineering Benchmarks

  4. SynH-Rank: Quality-Aware Code Search via Diverse Data Synthesis and Hierarchical Ranking Training

    Jul 19, 2026Keyu Liang, Haoye Wang, Yanfu Yan +2Learning to RankSoftware Engineering Benchmarks

  5. When to Use Which? Benchmarking Optimisers for Configurable Systems under Varying Budgets

    Jul 17, 2026Chao Jiang, Yulong Ye, Tao Chen +1Black-Box OptimizationSoftware Engineering Benchmarks

  6. GameEngineBench: Evaluating Coding Agents on Real C++ Runtime Environments

    Jul 3, 2026Brian La, Sejoon Chang, Ben Kim +5Coding AgentsSoftware Engineering Benchmarks

  7. TestEvo-Bench: An Executable and Live Benchmark for Test and Code Co-Evolution

    Jul 2, 2026Jiale Amber Wang, Kaiyuan Wang, Pengyu NieAutomated Software TestingBenchmark Design

  8. Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents?

    Jul 1, 2026Zhi Chen, Zhensu Sun, Yuling Shi +2Benchmark AuditingBenchmark Design

  9. SAKE: Software Architectural Knowledge Evaluation Benchmark for Large Language Models

    Jun 28, 2026Tiziano Santilli, Francesco Daghero, Mayhar Tourchi MoghaddamSoftware EngineeringLLM Evaluation

  10. Pooled Leaderboards Hide System-Specific Winners: A Reporting-Protocol Audit of Offline Root-Cause Analysis Benchmarks

    Jun 28, 2026Lining Hu, Ting Liu, Yuzhuo FuPairwise ComparisonAlgorithmic Auditing

  11. Diff-Based Code Corruption using LLMs for Large-Scale Bugfix Benchmarking

    Jun 27, 2026Balázs Szalontai, Ábel Szauter, Balázs Márton +3Software EngineeringAutomated Program Repair

  12. Evaluating LLMs on Real-World Software Performance Optimization

    Jun 24, 2026Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim +1Software EngineeringLLM Evaluation

  13. Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering

    Jun 16, 2026Maria I. Gorinova, Macey Baker, Amy Heineike +3AI Coding AgentsBenchmark Design

  14. CODA-BENCH: Can Code Agents Handle Data-Intensive Tasks?

    Jun 13, 2026Yuxin Zhang, Ju Fan, Meihao Fan +2AI Coding AgentsSoftware Engineering Benchmarks

  15. Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks

    Jun 10, 2026Mengyu Zheng, Kai Han, Boxun Li +13AI Coding AgentsSoftware Engineering Benchmarks

  16. SWE-Explore: Benchmarking How Coding Agents Explore Repositories

    Jun 5, 2026Shaoqiu Zhang, Yuhang Wang, Jialiang Liang +8AI Coding AgentsAgentic Search

  17. SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?

    Jun 5, 2026Rishi Desai, Jesse Hu, Joan Cabezas +23AI Coding AgentsSoftware Engineering Benchmarks

  18. TensorBench: Benchmarking Coding Agents on a Compiler-Based Tensor Framework

    Jun 4, 2026Bobby Yan, Fredrik KjolstadAI Coding AgentsBenchmark Design

  19. RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions

    Jun 2, 2026Zongwei Lv, Zhewen Tan, Yaoming Li +7Computer-Use Agent BenchmarksAI Coding Agents

  20. Handoff Debt: The Rediscovery Cost When Coding Agents Take Over Interrupted Tasks

    Jun 1, 2026Dipesh KC, Anjila BudathokiCoding AgentsSoftware Engineering Benchmarks

  21. TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories

    May 29, 2026Junjie Nian, Kang Chen, Ge Zhang +2Agent ReliabilitySoftware Engineering Benchmarks