Code Generation Evaluation

Momentum

17 papers in the last four weeks, up 113% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 147

All topics
CardsList
  1. EstRTL: Functional Estimation Guided RTL Code Generation

    Jun 1, 2026Qi Xiong, Renzhi Chen, Bowei Wang +3Code GenerationAgentic Code Generation

  2. BenchEvolver: Frontier Task Synthesis via Solution-Centric Evolution

    May 31, 2026Yangzhen Wu, Aaron J. Li, Wenjie Ma +10Synthetic Benchmark GenerationCode Generation Evaluation

  3. Accuracy, Stability, and Repeated-Run Reliability of Large Language Models on Deterministic Programming Tasks

    May 30, 2026Yongxi Zhou, Lai Yun Choi, Jiaxi Wen +1LLM EvaluationLanguage Model Generation Evaluation

  4. Benchmarking Multimodal LLMs on Code Generation for Complex Interactive Webpages

    May 29, 2026Fan Wu, Lishuai Dong, Cuiyun Gao +4Web Application GenerationCode Generation

  5. Inferring Code Correctness from Specification

    May 28, 2026Tambon Florian, Papadakis MikeAutomated Software TestingCode Generation Evaluation

  6. Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence

    May 27, 2026Linxin Song, Jiefeng Chen, Yue Huang +5Code Generation EvaluationCode Generation Benchmarks

  7. Beyond pass@k: Redundancy-Aware RLVR for Multi-Sample Code Generation

    May 27, 2026Le Bronnec Florian, Alexandre Verine, Rio Yokota +1RL for Code GenerationCode Generation

  8. Automating Formal Verification with Agent-Guided Tree Search

    May 26, 2026Leo YaoCode GenerationLLM-Based Program Synthesis

  9. PennySynth: RAG-Driven Data Synthesis for Automated Quantum Code Generation

    May 25, 2026Minghao Shao, Nouhaila Innan, Hariharan Janardhanan +3Code GenerationLLM-Based Program Synthesis

  10. An Empirical Evaluation of LLM-Generated Code Security Across Prompting Methods

    May 22, 2026Mohammed Kharma, Ahmed Sabbah, Mohammad Alkhanafseh +2LLM PromptingLLM Security

  11. VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents

    May 22, 2026JunJia Guo, Yuhang Yao, Jiawei +2Web Application GenerationWeb Agent Benchmarks

  12. Security of LLM-generated Code: A Comparative Analysis

    May 21, 2026Srivathsan G Morkonda, Mahmoud Selim, Hala AssalSoftware SecurityLLM Security

  13. Quality and Security Signals in AI-Generated Python Refactoring Pull Requests

    May 20, 2026Mohamed Almukhtar, Anwar Ghammam, Hua MingAI Coding AgentsAI Agent Security

  14. What Do Evolutionary Coding Agents Evolve?

    May 19, 2026Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou +4Evolutionary OptimizationAI Coding Agents

  15. WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games

    May 17, 2026Wenyu Zhang, Guoliang You, Tianlun +8Web Application GenerationAI Coding Agents

  16. When Retrieval Hurts Code Completion: A Diagnostic Study of Stale Repository Context

    May 14, 2026Haojun Weng, Qianqian Yang, Hao Fu +2Retrieval-Augmented GenerationRetrieval Robustness

  17. The Readability Spectrum: Patterns, Issues, and Prompt Effects in LLM-Generated Code

    May 13, 2026Hengzhi Ye, Fengyuan Ran, Weiwei Xu +1LLM PromptingCode Generation Evaluation

  18. Vision2Code: A Multi-Domain Benchmark for Evaluating Image-to-Code Generation

    May 11, 2026Ajay Vikram Periasami, Junlin Wang, Bhuwan DhingraVLM EvaluationCode Generation

  19. SmartEval: A Benchmark for Evaluating LLM-Generated Smart Contracts from Natural Language Specifications

    May 10, 2026Abhinav Goel, Agostino Capponi, Alfio Gliozzo +1Code GenerationCode Generation Evaluation

  20. Your Simulation Runs but Solves the Wrong Physics: PDE-Grounded Intent Verification for LLM-Generated Multiphysics Simulation Code

    May 10, 2026Zhenghan Song, Yulong Liu, Cheng Wan +4LLM Self-CorrectionScientific Code Generation

  21. Mage: Multi-Axis Evaluation of LLM-Generated Executable Game Scenes Beyond Compile-Pass Rate

    May 8, 2026Hugh Xuechen Liu, Kıvanç TatarCode GenerationCode Generation Evaluation