Code Generation Evaluation

Momentum

17 papers in the last four weeks, up 113% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 147

All topics
CardsList
  1. Characterizing the Quality Profile of AI-Generated C++ in Production

    Aug 6, 2026Michael Tran, Fred Lewis, Kun Yang +5Code GenerationCode Generation Evaluation

  2. Coding Agents as Test-Suite Auditors: Finding What Official Suites Miss While Approaching What They Catch

    Aug 3, 2026Shuyang Xie, Shuxiao Xie, Feng Zhu +2Automated Software TestingBenchmark Auditing

  3. Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation

    Aug 2, 2026Francis Luis Santos Vargas, Rodrigo Brandão Mansilha, Diego KreutzLLM EvaluationCode Generation

  4. TaPR: Test-Aware Policy Refinement for Feedback-Conditioned Code Generation

    Aug 1, 2026Aofan Liu, Jingxiang Meng, Fangxin Liu +1RL for Code GenerationReward Shaping

  5. Simulation Code Generation for Fluid Systems using Large Language Models: Benchmarking Models and Prompting Strategies

    Jul 31, 2026Jan Marius Stürmer, Jascha Knack, Tobias Koch +1LLM PromptingCode Generation Evaluation

  6. SecDrift: Measuring Sector-Conditioned Security Drift in AI-Generated Code

    Jul 28, 2026Narayanaswami Natraj Bharadwaj, Dhivya ChandramouleeswaranCybersecurityLLM Security

  7. RIDGE: An Autonomous Framework for Validation and Method Discovery in LLM-Generated Option Pricing

    Jul 28, 2026Liexin Cheng, Xue Cheng, Shuaiqiang Liu +1Quantitative FinanceCode Generation Evaluation

  8. Learning from 53.6K Real-World Developer Edits of AI-Generated Code

    Jul 27, 2026Jenny T. Liang, Mihika Bairathi, Wayne Chi +3Code Generation EvaluationCode Language Models

  9. The Best Programming Language for Tokenmaxxing: An Investigation of Coding Agent Behavior Across Programming Languages

    Jul 24, 2026Zixuan Wu, Carolyn Jane Anderson, Arjun GuhaAI Coding AgentsCode Generation

  10. MineValiCoder: Reliable Code Generation with Test Case Quality Mining and Bipartite Graph-Based Mutual Validation

    Jul 24, 2026Zhen Zhao, Qihang Yang, Feifei Dai +2Execution-Guided Code GenerationCode Generation

  11. How Do AI Coding Agents Contribute to Software Development? an Empirical Study of Agentic Pull Requests

    Jul 23, 2026Iren Mazloomzadeh, Mohammad Mehdi Morovati, Foutse KhomhSoftware Engineering AgentsAI Coding Agents

  12. Benchmarking LLMs for Verilog Design Flows

    Jul 23, 2026Angshuman Chakravertty, Rahul Koshti, Buddhi Prakash Sharma +1Code GenerationCode Generation Evaluation

  13. Code Monitor Red Teaming for Public-Test-Passing Code

    Jul 23, 2026Junchi Liao, Jiawen Deng, Fuji RenLLM AuditingCode Generation Evaluation

  14. Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?

    Jul 22, 2026Zuodong Xiang, Yike Zhang, YueMing Zhang +1Code Generation EvaluationAutomated Code Review

  15. SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

    Jul 21, 2026Weifeng Sun, Ye Fan, Yuchen Chen +6Scientific Code GenerationCode Generation Evaluation

  16. Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality

    Jul 16, 2026Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez +5Multilingual Language Model EvaluationCode Generation

  17. Quantize with Confidence? An Empirical Study of Quantization for Code Generation

    Jul 15, 2026Saima Afrin, Md. Zahidul Haque, Antonio MastropaoloLLM QuantizationCode Generation Evaluation

  18. Line-Anchored Feedback Cuts Token Costs and Improves Correctness in AI Code Editing

    Jul 14, 2026William Franz LambertiCode Generation EvaluationCode Language Models

  19. Token Reduction Is Not Cost Reduction

    Jul 13, 2026Sarel Weinberger, Amir HozezAI Coding AgentsCost-Aware Inference

  20. When Does Restricting a Coding Agent to execute_code Help? A Regime ×\times Agent-Design Ablation

    Jul 12, 2026Hong Yang, Qi Yu, Travis DesellCoding AgentsTool-Using Agents

  21. Knowledge-Conditioned, Single-Pass LLM Synthesis of Executable Unity Game Scenes: A Compiler Error Census across 26 Goal Playable Concepts

    Jul 11, 2026Hugh Xuechen Liu, Kıvanç TatarLLM-Based Program SynthesisProcedural Content Generation

  22. The Patchwork Problem in LLM-Generated Code

    Jul 9, 2026Viraaji Mothukuri, Reza M. PariziStatic Code AnalysisLLM Reliability

  23. PHITSBench: an execution-scored benchmark for AI-assisted PHITS radiation-transport input generation using natural language

    Jul 8, 2026Xianglin Ji, Svetlana V. BoriskinaKnowledge Augmentation for Language ModelsCode Generation