Software Engineering Benchmarks

Latest papers 89

All topics
CardsList
  1. Evaluating Exact Output and Checkpoint-State Prediction in Real Programs

    Oct 8, 2026Xiaohong Chen, David Bucur, Chenglong Ma +4LLM EvaluationSoftware Engineering Benchmarks

  2. SWE-Journey: Towards More Realistic Evaluation of Coding Assistants through Long-Horizon, Multi-Turn Interaction

    Oct 8, 2026Hexuan Deng, Yue Wang, Wenyu Jiang +13Coding AgentsAI Agent Benchmarks

  3. Coding-Agent Benchmarks Should Match Their Users' Task Flows

    Oct 7, 2026Igor Slinko, Yaroslav Golubev, Sergey TitovLLM Agent EvaluationAI Agent Benchmarks

  4. Correct Code, Broken Contributions? SWE-CC: Benchmarking Repository Policy Compliance for Coding Agents

    Oct 5, 2026Hai Dang Truong, Rayner Goh, Thanh Le-Cong +1AI Agent AuditingCoding Agents

  5. EngramBench: A Capability-Grounded Benchmark for Skill-Evolution Harnesses

    Sep 30, 2026Zhixuan Tan, Pengjie Gu, Zhao Li +4Software Engineering BenchmarksLong-Horizon Agent Evaluation

  6. Retrieve, Reproduce, Reveal: Dissecting Retrieval-Augmented Software Vulnerability Detection

    Sep 29, 2026Sabrina Kaniewski, Tim Krämer, Julius Bächle +3Software Vulnerability DetectionSoftware Engineering Benchmarks

  7. WitnessGym: Benchmarking Coding Agents on the Construction of Bug Witnesses

    Sep 29, 2026Haomin Qi, Xiangzhe Xu, Yiming Huang +2Software Engineering AgentsBenchmark Construction

  8. SWE-Prometheus: Measuring Engineering Governance Improvements in Real-World Repositories

    Sep 24, 2026Jiajun Wu, Leixin Sun, Zihan Tan +9Software EngineeringSoftware Engineering Agents

  9. Can LLMs Reason About Runtime Behavior? A Repository-Level Dynamic Benchmark

    Sep 23, 2026Hamed Taherkhani, Mohammad Abdollahi, Melika Sepidband +3LLM EvaluationSoftware Engineering Benchmarks

  10. The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks

    Sep 22, 2026Wenbo Pan, Zhichao Liu, Shujie Liu +6Software Engineering BenchmarksLong-Horizon Agent Evaluation

  11. VibeMemBench: Evaluating Memory Systems for Coding Agents on Real Repository Coding Tasks

    Sep 20, 2026Liyang Fan, Yingcheng Shi, Yongbin Li +7Benchmark DesignSoftware Engineering Benchmarks

  12. ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks

    Sep 16, 2026Jeonghye Kim, Minseon Kim, Young Jin Kim +5Coding AgentsSoftware Engineering Benchmarks

  13. Skill Issue: Lessons from Optimizing Repository SKILLs for Coding Agents

    Sep 14, 2026Mykhailo Kozyrev, Andrei Kozyrev, Anton PodkopaevSoftware Engineering AgentsSoftware Engineering Benchmarks

  14. SemVerBench: Benchmarking LLM Comprehension of Version-Constraint Resolution Semantics

    Sep 10, 2026Qibai Chen, Zeming LiuSoftware EngineeringLLM Evaluation

  15. SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents

    Sep 8, 2026Pujun Zheng, Zixin Shang, Shufan Jiang +5Reward HackingSoftware Engineering Agents

  16. SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents

    Sep 3, 2026Xin He, Yanlin Wang, Mingwei Liu +3Software Engineering AgentsAutomated Program Repair

  17. Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation

    Sep 1, 2026Kefeng Duan, Dewu Zheng, Yanlin Wang +7Software Engineering BenchmarksLLM Agent Evaluation

  18. RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests

    Aug 28, 2026Gyuhyeong Kim, Hyojung Gwon, Jeonghyeon Kim +2LLM PromptingCoding Agents

  19. SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?

    Aug 20, 2026Zhipeng Xu, Jiahao Lu, Yining Zheng +2Software EngineeringAutomated Program Repair

  20. VICBench: A Multi-Language Benchmark for Code Vulnerability Detection

    Aug 12, 2026Jin Lu, Xuening Han, Yang Zhong +4Software Vulnerability DetectionSoftware Engineering Benchmarks

  21. SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

    Aug 10, 2026Yuling Shi, Jinghan Xu, Kelin Fu +12AI Coding AgentsSoftware Engineering Benchmarks

  22. RepoProbe: Benchmarking Architecture-Aware Repository Comprehension with Checklists

    Aug 5, 2026Yuexi Yang, Alyssa Wu, Ji Luo +4Software EngineeringLLM Evaluation

  23. Active-SWE: Benchmarking Coding Agents for Proactive Bug Fixing without Issue Reports

    Aug 5, 2026Haobin Li, Ping Deng, Weizhong Qian +4Automated Program RepairAI Coding Agents

  24. SWE-Touch: Benchmarking Coding Agents When Users Touch the Code

    Aug 3, 2026Yuqiao Tan, Jinxiang Meng, Fangyu Lei +4Coding AgentsSoftware Engineering Benchmarks

  25. LoopsBench: From Harness Engineering to Loop Engineering in Coding Agent Evaluation

    Jul 31, 2026Han Li, Zhemin Fang, Rili Feng +8AI Coding AgentsSoftware Engineering Benchmarks

  26. PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks

    Jul 30, 2026Manyi Wang, Junjielong Xu, Pinjia HeBenchmark AuditingSoftware Engineering Benchmarks

  27. An Empirical Study of Coordination Mode as the First-Class Citizen in From-Scratch Multi-Agent Coding

    Jul 30, 2026Yanyu Ren, Yunfeng Bai, Xizheng Wang +2Multi-Agent CoordinationMulti-Agent Orchestration