Code Generation Evaluation

Momentum

17 papers in the last four weeks, up 113% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 145

All topics
CardsList
  1. TaoD2C-Bench: Benchmarking MLLMs for Industrial UI Code Generation Beyond Visual Fidelity

    Oct 7, 2026Chengwei Shi, Yunnong Chen, Tingting Zhou +5Code GenerationCode Generation Evaluation

  2. AeroEval: Staged Program and Execution Validation for AI-Generated Drone Missions

    Oct 7, 2026Kautuk Astu, Naina Rabha, Yogesh SimmhanCode Generation EvaluationAerial Robotics

  3. Verification Trap: Understanding Test-Time Selection Failures under False Premises in Code Generation

    Oct 4, 2026Feng He, Hejia Wang, Linghao Meng +2Execution-Guided Code GenerationCode Generation Evaluation

  4. Groundability, Not Scale Alone: When Weak Reviewers Can Audit Strong Coding Agents

    Oct 1, 2026Junyu Guo, Shangding Gu, Ming Jin +1AI Agent AuditingCode Generation Evaluation

  5. Code That Works, Environments That Don't: Measuring Environment Reproducibility in AI-Generated Software

    Sep 30, 2026Bhanu Prakash Vangala, Tanu MalikCoding AgentsCode Generation

  6. A2Z GameSpec-Bench: How Faithfully Can Coding Agents Generate Games from Game Design Specifications?

    Sep 30, 2026Seonho Lee, Wonryeol Jeong, Alberto Cereser +4AI Coding AgentsAI Agent Benchmarks

  7. Metrics Failure in LLM-Based Code Vulnerability Repair: An Empirical Study and a Change-Aware Screen

    Sep 22, 2026Om Nepal, Sushant Aryal, Oluseyi Olukola +1Automated Program RepairLLMs for Cybersecurity

  8. ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks

    Sep 16, 2026Jeonghye Kim, Minseon Kim, Young Jin Kim +5Coding AgentsSoftware Engineering Benchmarks

  9. An Empirical Evaluation of Cost-Efficient Large Language Models on Algorithmic Programming Tasks

    Sep 16, 2026Chandimal Adikari, Nandika HerathCode GenerationLLM Reliability

  10. DepthBenchCAD: When Does Deeper Auditing Yield More Reliable Conclusions?

    Sep 14, 2026Hongye Yang, Zhihao Xie, Shengjun Xiong +1Benchmark AuditingText-to-CAD Generation

  11. What is the Difference Between Me and You? Benchmarking the Quality Gap Between Human-Written and AI-Generated Code

    Sep 14, 2026Cristina Improta, Pietro Liguori, Domenico CotroneoLLM SecurityCode Generation Evaluation

  12. The Vibe Shift in Software Engineering: Evaluating AI-Led Conversational Programming for Performance, Cognition, and Responsible Adoption

    Sep 10, 2026Sales G. Aribe Jr., Louie Jay S. LabastidaCode Generation EvaluationHuman-AI Collaboration

  13. It Is Not My Code Anymore

    Sep 8, 2026Augusto CamargoAlgorithmic AccountabilityCode Generation Evaluation

  14. CodeTD: Topology of Attention Detects Hallucinations in Code LLMs

    Sep 7, 2026Daria Voronkova, Ilya Trofimov, Anton Dmitriev +3LLM Hallucination DetectionCode Generation Evaluation

  15. Rubric-to-Code Credit Assignment for Reinforcement Learning

    Aug 28, 2026Rui Jin, Jikai Chen, Yihan Chen +6RL for Code GenerationCode Generation

  16. RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests

    Aug 28, 2026Gyuhyeong Kim, Hyojung Gwon, Jeonghyeon Kim +2LLM PromptingCoding Agents

  17. QuoteBench: How Matched Scores Can Hide Command-Path Failures

    Aug 13, 2026Shangao Li, Yao Zhang, Volker Tresp +1LLM Agent EvaluationAgent Evaluation

  18. VisEditBench: Can Vision-Language Models Edit Visualization Code from Multimodal Feedback?

    Aug 11, 2026Mizanur Rahman, Arshia Azimlu, Shadikur Rahman +4VLM EvaluationData Visualization

  19. Characterizing the Quality Profile of AI-Generated C++ in Production

    Aug 6, 2026Michael Tran, Fred Lewis, Kun Yang +5Code GenerationCode Generation Evaluation

  20. Coding Agents as Test-Suite Auditors: Finding What Official Suites Miss While Approaching What They Catch

    Aug 3, 2026Shuyang Xie, Shuxiao Xie, Feng Zhu +2Automated Software TestingBenchmark Auditing

  21. Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation

    Aug 2, 2026Francis Luis Santos Vargas, Rodrigo Brandão Mansilha, Diego KreutzLLM EvaluationCode Generation

  22. TaPR: Test-Aware Policy Refinement for Feedback-Conditioned Code Generation

    Aug 1, 2026Aofan Liu, Jingxiang Meng, Fangxin Liu +1RL for Code GenerationReward Shaping

  23. Simulation Code Generation for Fluid Systems using Large Language Models: Benchmarking Models and Prompting Strategies

    Jul 31, 2026Jan Marius Stürmer, Jascha Knack, Tobias Koch +1LLM PromptingCode Generation Evaluation

  24. SecDrift: Measuring Sector-Conditioned Security Drift in AI-Generated Code

    Jul 28, 2026Narayanaswami Natraj Bharadwaj, Dhivya ChandramouleeswaranCybersecurityLLM Security

  25. RIDGE: An Autonomous Framework for Validation and Method Discovery in LLM-Generated Option Pricing

    Jul 28, 2026Liexin Cheng, Xue Cheng, Shuaiqiang Liu +1Quantitative FinanceCode Generation Evaluation

  26. Learning from 53.6K Real-World Developer Edits of AI-Generated Code

    Jul 27, 2026Jenny T. Liang, Mihika Bairathi, Wayne Chi +3Code Generation EvaluationCode Language Models

  27. The Best Programming Language for Tokenmaxxing: An Investigation of Coding Agent Behavior Across Programming Languages

    Jul 24, 2026Zixuan Wu, Carolyn Jane Anderson, Arjun GuhaAI Coding AgentsCode Generation

  28. MineValiCoder: Reliable Code Generation with Test Case Quality Mining and Bipartite Graph-Based Mutual Validation

    Jul 24, 2026Zhen Zhao, Qihang Yang, Feifei Dai +2Execution-Guided Code GenerationCode Generation

  29. How Do AI Coding Agents Contribute to Software Development? an Empirical Study of Agentic Pull Requests

    Jul 23, 2026Iren Mazloomzadeh, Mohammad Mehdi Morovati, Foutse KhomhSoftware Engineering AgentsAI Coding Agents

  30. Benchmarking LLMs for Verilog Design Flows

    Jul 23, 2026Angshuman Chakravertty, Rahul Koshti, Buddhi Prakash Sharma +1Code GenerationCode Generation Evaluation

  31. Code Monitor Red Teaming for Public-Test-Passing Code

    Jul 23, 2026Junchi Liao, Jiawen Deng, Fuji RenLLM AuditingCode Generation Evaluation

  32. Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?

    Jul 22, 2026Zuodong Xiang, Yike Zhang, YueMing Zhang +1Code Generation EvaluationAutomated Code Review

  33. SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

    Jul 21, 2026Weifeng Sun, Ye Fan, Yuchen Chen +6Scientific Code GenerationCode Generation Evaluation

  34. Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality

    Jul 16, 2026Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez +5Multilingual Language Model EvaluationCode Generation

  35. Quantize with Confidence? An Empirical Study of Quantization for Code Generation

    Jul 15, 2026Saima Afrin, Md. Zahidul Haque, Antonio MastropaoloLLM QuantizationCode Generation Evaluation

  36. Line-Anchored Feedback Cuts Token Costs and Improves Correctness in AI Code Editing

    Jul 14, 2026William Franz LambertiCode Generation EvaluationCode Language Models

  37. Token Reduction Is Not Cost Reduction

    Jul 13, 2026Sarel Weinberger, Amir HozezAI Coding AgentsCost-Aware Inference

  38. When Does Restricting a Coding Agent to execute_code Help? A Regime ×\times Agent-Design Ablation

    Jul 12, 2026Hong Yang, Qi Yu, Travis DesellCoding AgentsTool-Using Agents

  39. Knowledge-Conditioned, Single-Pass LLM Synthesis of Executable Unity Game Scenes: A Compiler Error Census across 26 Goal Playable Concepts

    Jul 11, 2026Hugh Xuechen Liu, Kıvanç TatarLLM-Based Program SynthesisProcedural Content Generation

  40. The Patchwork Problem in LLM-Generated Code

    Jul 9, 2026Viraaji Mothukuri, Reza M. PariziStatic Code AnalysisLLM Reliability

  41. PHITSBench: an execution-scored benchmark for AI-assisted PHITS radiation-transport input generation using natural language

    Jul 8, 2026Xianglin Ji, Svetlana V. BoriskinaKnowledge Augmentation for Language ModelsCode Generation