Code Generation Benchmarks

Latest papers 104

All topics
CardsList
  1. Beyond Pass Rate: A Multilingual, Execution-Grounded Evaluation of Open Code LLMs

    Jun 7, 2026Sayed Erfan ArefinCode Generation EvaluationCode Language Models

  2. Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement

    Jun 4, 2026Xin Wang, Liangtai Sun, Yaoming Zhu +8Computer-Use Agent BenchmarksLanguage Model Generation Evaluation

  3. CodegenBench: Can LLMs Write Efficient Code Across Architectures?

    Jun 1, 2026Jie Li, Wenzhao Wu, Junqi Hu +5High-Performance ComputingCode Generation

  4. WorldCoder-Bench: Benchmarking Physically Grounded 3D World Synthesis

    Jun 1, 2026Shuo Lu, Yinuo Xu, Kecheng Yu +8LLM-Based Program SynthesisSynthetic Benchmark Generation

  5. BenchEvolver: Frontier Task Synthesis via Solution-Centric Evolution

    May 31, 2026Yangzhen Wu, Aaron J. Li, Wenjie Ma +10Synthetic Benchmark GenerationCode Generation Evaluation

  6. 3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code

    May 31, 2026Yipeng Gao, Lei Shu, Genzhi Ye +5VLM Evaluation3D Asset Generation

  7. Knowledge boundary probing and demand-guided intervention for LLM-based power system code generation

    May 29, 2026Hui Wu, Xiaoyang Wang, Zhong FanAutomated Program RepairCode Generation

  8. Benchmarking Multimodal LLMs on Code Generation for Complex Interactive Webpages

    May 29, 2026Fan Wu, Lishuai Dong, Cuiyun Gao +4Web Application GenerationCode Generation

  9. Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence

    May 27, 2026Linxin Song, Jiefeng Chen, Yue Huang +5Code Generation EvaluationCode Generation Benchmarks

  10. Do LLMs Favor Their Providers? Measuring Vertical Integration Bias in Code Generation

    May 27, 2026Melih Catal, Alex Wolf, Tiago Ferreiro Matos +2Agentic Code GenerationAlgorithmic Bias

  11. GUI Agents for Continual Game Generation

    May 27, 2026Yixu Huang, Bo Li, Na Li +8GUI AgentsCode Generation

  12. VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation

    May 21, 2026Yifan Bai, Xiaoyang Liu, Zihao Mou +7Code GenerationSynthetic Benchmark Generation

  13. PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning

    May 19, 2026Qiran Zhang, Yuheng Wang, Runde Yang +9Spatial ReasoningCode Generation Benchmarks

  14. Rule2DRC: Benchmarking LLM Agents for DRC Script Synthesis with Execution-Guided Test Generation

    May 15, 2026Jinuk Kim, Junsoo Byun, Donghwi Hwang +2Electronic Design AutomationLLM Agent Evaluation

  15. Vision2Code: A Multi-Domain Benchmark for Evaluating Image-to-Code Generation

    May 11, 2026Ajay Vikram Periasami, Junlin Wang, Bhuwan DhingraVLM EvaluationCode Generation

  16. BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD

    May 11, 2026Haozhe Zhang, Kaichen Liu, Miaomiao Chen +4Benchmark ConstructionParametric CAD Modeling

  17. PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation

    May 10, 2026Zhen Hang, Yushan Yashengjiang, Junhui Li +21PDE SolvingBenchmark Design

  18. VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation

    May 8, 2026Zichen Xie, Mrigank Pawagi, Yuxin Liu +5Code GenerationFormal Verification

  19. Mage: Multi-Axis Evaluation of LLM-Generated Executable Game Scenes Beyond Compile-Pass Rate

    May 8, 2026Hugh Xuechen Liu, Kıvanç TatarCode GenerationCode Generation Evaluation

  20. Constraint Decay: The Fragility of LLM Agents in Backend Code Generation

    May 7, 2026Francesco Dente, Dario Satriani, Paolo PapottiAI Coding AgentsCode Generation

  21. MolViBench: Evaluating LLMs on Molecular Vibe Coding

    May 4, 2026Jiatong Li, Yuxuan Ren, Weida Wang +4AI-Assisted Scientific ResearchScientific Code Generation

  22. RuC: HDL-Agnostic Rule Completion Benchmark Generation

    Apr 30, 2026Arnau Ayguadé Domingo, Miquel Alberti-Binimelis, Cristian Gutierrez-Gomez +5LLM EvaluationLLM Prompting

  23. ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation

    Apr 29, 2026Yeheng Chen, Chaoxiang Xie, Yuling Shi +4Code GenerationSynthetic Benchmark Generation