Code Generation Benchmarks

Latest papers 104

All topics
CardsList
  1. TaoD2C-Bench: Benchmarking MLLMs for Industrial UI Code Generation Beyond Visual Fidelity

    Oct 7, 2026Chengwei Shi, Yunnong Chen, Tingting Zhou +5Code GenerationCode Generation Evaluation

  2. From Pixel to Coding: Evaluating the Figure Reproduction Capabilities of MLLMs

    Oct 7, 2026Zijian Chen, Zhengyu Chen, Bohan Liang +7Multimodal Large Language ModelsMultimodal Model Evaluation

  3. Large-scale Repository Engineering via Agent-Native Reusable Code Primitives

    Oct 6, 2026Haibo Jin, Peng Kuang, Xucheng Yu +3Repository-Level Code GenerationSoftware Engineering

  4. GNN-CB: A Graph Neural Network Competition Benchmark for Human and LLM Evaluation

    Oct 4, 2026Murad Hossen, Tasneem Selim, Gurur Gamgam +22LLM EvaluationGraph Neural Networks

  5. VHDL-REPOBENCH: A Repository-Level Benchmark for Evaluating Large Language Models on VHDL Design Generation

    Oct 4, 2026Prashanth Vijayaraghavan, Akul Malhotra, Ashutosh Jadhav +2LLM EvaluationCode Generation

  6. Self-Spec Verifiable Code Generation

    Sep 30, 2026Jiaru Qian, Yihong Dong, Yongmin Li +3LLM Self-CorrectionCode Generation

  7. Zero2Repo: Can Coding Agents Build Repositories from Scratch?

    Sep 29, 2026Pei Yang, Tianyu Shi, Yuhang Yao +23Coding AgentsAI Agent Benchmarks

  8. LoLBench: Evaluating Coding Agents with Long-Horizon Proposals on Large Software Systems

    Sep 29, 2026Yun Peng, Zihan Wu, Zeyang Zhuang +6Software EngineeringAI Coding Agents

  9. Do Coding Agents Reuse Existing Code or Reinvent the Wheel?

    Sep 28, 2026Dongsheng Ma, Sizhe Wang, Xinyi Huang +5Coding AgentsCode Generation

  10. MetaBench-Harness: Unlocking End-to-End Optimization of Benchmark Harnesses

    Sep 27, 2026Xuanjun Chen, Hua-Hsuan Chen, Wei-Chung Lu +3LLM EvaluationBenchmark Design

  11. SWE-Proof: Can Language Models Resolve Real-World Issues with Machine-Checked Proofs?

    Sep 18, 2026George Ma, Benjamin Mikek, Haoyu Li +9Formal VerificationAgentic Code Generation

  12. What is the Difference Between Me and You? Benchmarking the Quality Gap Between Human-Written and AI-Generated Code

    Sep 14, 2026Cristina Improta, Pietro Liguori, Domenico CotroneoLLM SecurityCode Generation Evaluation

  13. Retrofitting Code Using LLMs to Support Exceptional Behavior

    Sep 9, 2026Linghan Zhong, Jiyang Zhang, Jayanth Srinivasa +2Code GenerationCode Generation Benchmarks

  14. GVS5H: Zero-Shot Self-Orchestration with Ledger-Based Control for Improved LLM Coding Performance

    Aug 27, 2026Victor Gao, Vida Khosrowshahi, Ali Khosrowshahi +4Zero-Shot LearningMulti-Agent LLM Systems

  15. Vero: Can AI Agents Build Formally Verified Software Repositories?

    Aug 13, 2026Zhe Ye, Hantao Lou, Yuechun Sun +8Code GenerationFormal Verification

  16. P3^{3}: Joint Program-and-Proof Planning for Verified Code Generation

    Aug 10, 2026Zenan Li, Ziran Yang, Peiyang Song +2Code GenerationFormal Verification

  17. A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents

    Aug 10, 2026Xin Zhou, Chun Yong Chong, Kisub Kim +11Requirements EngineeringAI Coding Agents

  18. SciCode-Verified: How Benchmark Defects Underestimated the Scientific-Coding Ability of Language Models

    Aug 5, 2026Sihan Hu, Lyuhan Huang, Youjin Deng +1LLM EvaluationScientific Code Generation

  19. MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification

    Aug 4, 2026Qiming Li, Shujie Hu, Haohan Liu +3Code GenerationAI Agent Benchmarks

  20. FinHardBench: Can LLMs Generate Latency-Aware Hardware for Financial Computing?

    Aug 2, 2026Weimin Fu, Hejia Zhang, Minghao Shao +6Large Language Model-Guided OptimizationElectronic Design Automation

  21. EduPluginBench: Executable Assurance for AI-Generated Educational Plugins

    Aug 1, 2026Nizam KadirSoftware SecurityRuntime Assurance

  22. Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments

    Jul 30, 2026Haomin Qi, Xingliang Wang, Xuanqi Gao +9Code Generation BenchmarksAgent Benchmarks

  23. Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants

    Jul 29, 2026Zijian Xu, Wenshuo Zhang, Zisen Qin +4Knowledge Augmentation for Language ModelsCode Generation

  24. Benchmarking LLMs for Verilog Design Flows

    Jul 23, 2026Angshuman Chakravertty, Rahul Koshti, Buddhi Prakash Sharma +1Code GenerationCode Generation Evaluation

  25. ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders

    Jul 23, 2026Zhongyuan Peng, Dan Huang, Chuyu Zhang +8Coding AgentsSoftware Engineering Benchmarks

  26. SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

    Jul 21, 2026Weifeng Sun, Ye Fan, Yuchen Chen +6Scientific Code GenerationCode Generation Evaluation

  27. Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality

    Jul 16, 2026Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez +5Multilingual Language Model EvaluationCode Generation

  28. BackendForge: Benchmarking Agentic End-to-End Code Generation with Backend Services

    Jul 13, 2026Yuzhe Guo, Mengzhou Wu, Yuan Cao +4Tool-Augmented Language Model AgentsLanguage Model Generation Evaluation

  29. When Does Restricting a Coding Agent to execute_code Help? A Regime ×\times Agent-Design Ablation

    Jul 12, 2026Hong Yang, Qi Yu, Travis DesellCoding AgentsTool-Using Agents

  30. PHITSBench: an execution-scored benchmark for AI-assisted PHITS radiation-transport input generation using natural language

    Jul 8, 2026Xianglin Ji, Svetlana V. BoriskinaKnowledge Augmentation for Language ModelsCode Generation

  31. Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards

    Jul 6, 2026Tianhao Niu, Ziyu Han, Qiguang Chen +5Data VisualizationCode Generation Evaluation

  32. Benchmarking API Drift in LLM-Generated Quantum Code Across Successive SDK Versions

    Jul 5, 2026Mohammad Arif Rasyidi, Syahirul FaizCode Generation BenchmarksLLM Code Generation

  33. AxDafny: Agentic Verified Code Generation in Dafny

    Jun 30, 2026Benjamin Breen, Austin Letson, Borja Requena Pozo +1Code GenerationFormal Verification

  34. AlgoBench: Benchmarking Algorithmic Adaptation in Code Generation

    Jun 30, 2026Xinyuan Song, Zekun Cai, Liang ZhaoSynthetic Benchmark GenerationCode Generation Evaluation

  35. MirrorCode: AI can rebuild entire programs from behavior alone

    Jun 29, 2026Tom Adamczewski, David Owen, David Rein +4Software Engineering AgentsAI Agent Benchmarks

  36. LibEvoBench: Probing Temporal Knowledge Stratification in Code Generation Models

    Jun 24, 2026Daniele Cipollone, Sergey Titov, Maliheh Izadi +2Software EngineeringTemporal Reasoning in Language Models

  37. The Verifier is the Curriculum: Execution-Gated Self-Distillation for Cross-Family Game Generation

    Jun 23, 2026Chenyu Zhou, Qiliang Jiang, Shuning Wu +1Execution-Guided Code GenerationLanguage Model Distillation

  38. Text2DSL: LLM-Based Code Generation for Domain-Specific Languages

    Jun 21, 2026Alexander V. Kozachok, Alexander M. Nazimov, Shamil G. MagomedovLLM PromptingCode Generation

  39. NL2Scratch: An Executable Benchmark and Evaluation for Block-Based Programming

    Jun 20, 2026Heejin Do, Alexandre Ballenghien, Yang Wu +1Code GenerationCode Generation Evaluation

  40. Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages

    Jun 18, 2026Maria Ivanova, Pavel Zadorozhny, Rodion Levichev +5Code GenerationCode Generation Evaluation

  41. JAMER: Project-Level Code Framework Dataset and Benchmark on Professional Game Engines

    Jun 18, 2026Jianwen Sun, Chuanhao Li, Zizhen Li +5Benchmark DesignCode Generation

  42. CODA-BENCH: Can Code Agents Handle Data-Intensive Tasks?

    Jun 13, 2026Yuxin Zhang, Ju Fan, Meihao Fan +2AI Coding AgentsSoftware Engineering Benchmarks

  43. IterCAD: An Iterative Multimodal Agent for Visually-Grounded CAD Generation and Editing

    Jun 11, 2026Tao Hu, Jiaxin Ai, Licheng Wen +12Parametric CAD ModelingText-to-CAD Generation

  44. VHDLSuite: Unified Pipeline for LLM VHDL Generation with Data Synthesis and Evaluation

    Jun 11, 2026Yijun Shen, Minghao Shao, Yichen Zhao +4LLM EvaluationCode Generation

  45. Beyond Problem Solving: UOJ-Bench for Evaluating Code Generation, Hacking, and Repair in Competitive Programming

    Jun 11, 2026Tingqiang Xu, Hangrui Zhou, Tianle Cai +2Automated Program RepairCompetitive Programming

  46. CodeAlchemy: Synthetic Code Rewriting at Scale

    Jun 8, 2026Ankit Gupta, Aditya Prasad, Rameswar PandaSynthetic Data PretrainingSynthetic Data Generation