Code Generation Benchmarks

Latest papers 104

All topics
CardsList
  1. Benchmarking LLMs for Verilog Design Flows

    Jul 23, 2026Angshuman Chakravertty, Rahul Koshti, Buddhi Prakash Sharma +1Code GenerationCode Generation Evaluation

  2. ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders

    Jul 23, 2026Zhongyuan Peng, Dan Huang, Chuyu Zhang +8Coding AgentsSoftware Engineering Benchmarks

  3. SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

    Jul 21, 2026Weifeng Sun, Ye Fan, Yuchen Chen +6Scientific Code GenerationCode Generation Evaluation

  4. Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality

    Jul 16, 2026Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez +5Multilingual Language Model EvaluationCode Generation

  5. BackendForge: Benchmarking Agentic End-to-End Code Generation with Backend Services

    Jul 13, 2026Yuzhe Guo, Mengzhou Wu, Yuan Cao +4Tool-Augmented Language Model AgentsLanguage Model Generation Evaluation

  6. When Does Restricting a Coding Agent to execute_code Help? A Regime ×\times Agent-Design Ablation

    Jul 12, 2026Hong Yang, Qi Yu, Travis DesellCoding AgentsTool-Using Agents

  7. PHITSBench: an execution-scored benchmark for AI-assisted PHITS radiation-transport input generation using natural language

    Jul 8, 2026Xianglin Ji, Svetlana V. BoriskinaKnowledge Augmentation for Language ModelsCode Generation

  8. Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards

    Jul 6, 2026Tianhao Niu, Ziyu Han, Qiguang Chen +5Data VisualizationCode Generation Evaluation

  9. Benchmarking API Drift in LLM-Generated Quantum Code Across Successive SDK Versions

    Jul 5, 2026Mohammad Arif Rasyidi, Syahirul FaizCode Generation BenchmarksLLM Code Generation

  10. AxDafny: Agentic Verified Code Generation in Dafny

    Jun 30, 2026Benjamin Breen, Austin Letson, Borja Requena Pozo +1Code GenerationFormal Verification

  11. AlgoBench: Benchmarking Algorithmic Adaptation in Code Generation

    Jun 30, 2026Xinyuan Song, Zekun Cai, Liang ZhaoSynthetic Benchmark GenerationCode Generation Evaluation

  12. MirrorCode: AI can rebuild entire programs from behavior alone

    Jun 29, 2026Tom Adamczewski, David Owen, David Rein +4Software Engineering AgentsAI Agent Benchmarks

  13. LibEvoBench: Probing Temporal Knowledge Stratification in Code Generation Models

    Jun 24, 2026Daniele Cipollone, Sergey Titov, Maliheh Izadi +2Software EngineeringTemporal Reasoning in Language Models

  14. The Verifier is the Curriculum: Execution-Gated Self-Distillation for Cross-Family Game Generation

    Jun 23, 2026Chenyu Zhou, Qiliang Jiang, Shuning Wu +1Execution-Guided Code GenerationLanguage Model Distillation

  15. Text2DSL: LLM-Based Code Generation for Domain-Specific Languages

    Jun 21, 2026Alexander V. Kozachok, Alexander M. Nazimov, Shamil G. MagomedovLLM PromptingCode Generation

  16. NL2Scratch: An Executable Benchmark and Evaluation for Block-Based Programming

    Jun 20, 2026Heejin Do, Alexandre Ballenghien, Yang Wu +1Code GenerationCode Generation Evaluation

  17. Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages

    Jun 18, 2026Maria Ivanova, Pavel Zadorozhny, Rodion Levichev +5Code GenerationCode Generation Evaluation

  18. JAMER: Project-Level Code Framework Dataset and Benchmark on Professional Game Engines

    Jun 18, 2026Jianwen Sun, Chuanhao Li, Zizhen Li +5Benchmark DesignCode Generation

  19. CODA-BENCH: Can Code Agents Handle Data-Intensive Tasks?

    Jun 13, 2026Yuxin Zhang, Ju Fan, Meihao Fan +2AI Coding AgentsSoftware Engineering Benchmarks

  20. IterCAD: An Iterative Multimodal Agent for Visually-Grounded CAD Generation and Editing

    Jun 11, 2026Tao Hu, Jiaxin Ai, Licheng Wen +12Parametric CAD ModelingText-to-CAD Generation

  21. VHDLSuite: Unified Pipeline for LLM VHDL Generation with Data Synthesis and Evaluation

    Jun 11, 2026Yijun Shen, Minghao Shao, Yichen Zhao +4LLM EvaluationCode Generation

  22. Beyond Problem Solving: UOJ-Bench for Evaluating Code Generation, Hacking, and Repair in Competitive Programming

    Jun 11, 2026Tingqiang Xu, Hangrui Zhou, Tianle Cai +2Automated Program RepairCompetitive Programming

  23. CodeAlchemy: Synthetic Code Rewriting at Scale

    Jun 8, 2026Ankit Gupta, Aditya Prasad, Rameswar PandaSynthetic Data PretrainingSynthetic Data Generation