Code Generation Evaluation

Momentum

17 papers in the last four weeks, up 113% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 147

All topics
CardsList
  1. Correct Code, Vulnerable Dependencies: A Large Scale Measurement Study of LLM-Specified Library Versions

    May 7, 2026Chengjie Wang, Jingzheng Wu, Xiang Ling +2Software EngineeringLLM Security

  2. Beyond BLEU: A Semantic Evaluation Method for Code Translation

    May 6, 2026Julius Näumann, Sven Keidel, Amir Molzam Sharifloo +1Code TranslationCode Generation Evaluation

  3. Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code

    May 6, 2026Kaifeng He, Xiaojun Zhang, Peiliang Cai +7Training Data CurationCode Generation Evaluation

  4. Measuring and Mitigating Bias in Code Generated by Large Language Models

    May 5, 2026Yuxi Chen, Yutian Tang, Timothy StorerAlgorithmic BiasLanguage Model Bias Evaluation

  5. MolViBench: Evaluating LLMs on Molecular Vibe Coding

    May 4, 2026Jiatong Li, Yuxuan Ren, Weida Wang +4AI-Assisted Scientific ResearchScientific Code Generation

  6. Social Bias in LLM-Generated Code: Benchmark and Mitigation

    May 1, 2026Fazle Rabbi, Lin Ling, Song Wang +1Social Bias in Language ModelsAgentic Code Generation

  7. Defective Task Descriptions in LLM-Based Code Generation: Detection and Analysis

    Apr 27, 2026Amal Akli, Mike Papadakis, Maxime Cordy +1Code Generation EvaluationLanguage Model Robustness

  8. Characterizing Paraphrase-Induced Failures in Lean 4 Autoformalization

    Apr 25, 2026William Feng, Ethan Lou, Aryan SharmaLean Theorem ProvingCode Generation Evaluation

  9. BLAST: Benchmarking LLMs with ASP-based Structured Testing

    Apr 24, 2026Manuel Alejandro Borroto Santana, Erica Coppolillo, Francesco Calimeri +3Logic ProgrammingLLM Evaluation

  10. From If-Statements to ML Pipelines: Revisiting Bias in Code-Generation

    Apr 23, 2026Minh Duc Bui, Xenia Heilmann, Mattia Cerrato +2Algorithmic BiasCode Generation Evaluation

  11. Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering

    Apr 18, 2026Zixiao Zhao, Amirreza Esmaeili, Fatemeh FardSoftware EngineeringLLM-as-a-Judge

  12. ACES: Who Tests the Tests? Leave-One-Out AUC Consistency for Code Generation

    Apr 5, 2026Hui Sun, Yun-Ji Zhang, Zheng Xie +4Language Model Generation EvaluationCode Generation Evaluation

  13. Declarative by Design, Assistable Only by Convention: Benchmarking Multi-Agent Frameworks for AI-Assistability

    Feb 3, 2026Shafiuddin Rehan Ahmed, Sourabh DeshpandeAI Agent BenchmarksCode Generation Evaluation

  14. Can Coding Agents Migrate to Post-Quantum Cryptography?

    Dec 15, 2025Abdulmalik AlquwayfiliCoding AgentsCode Generation Evaluation

  15. From Charts to Code: A Hierarchical Benchmark for Multimodal Models

    Oct 20, 2025Jiahao Tang, Henry Hengyuan Zhao, Lijian Wu +8Data VisualizationCode Generation

  16. LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads?

    Oct 10, 2025Kaijian Zou, Aaron Xiong, Yunxiang Zhang +6LLM EvaluationCompetitive Programming

  17. Investigating The Smells of LLM Generated Code

    Oct 3, 2025Debalina Ghosh Paul, Hong Zhu, Ian BayleySoftware EngineeringCode Generation Evaluation

  18. Benchmarking Web API Integration Code Generation

    Sep 24, 2025Daniel Maninger, Leon Chemnitz, Amir Molzam Sharifloo +2Code GenerationCode Generation Evaluation

  19. Experimental Analysis of Productive Interaction Strategy with ChatGPT: User Study on Function and Project-level Code Generation Tasks

    Aug 6, 2025Sangwon Hyun, Hyunjun Kim, Jinhyuk Jang +2LLM PromptingCode Generation

  20. Code Benchmarks Should Prioritize Rigor, Reliability, and Reproducibility

    Jan 18, 2025Jialun Cao, Yuk-Kit Chan, Zixuan Ling +12Benchmark ConstructionBenchmark Design

  21. An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc

    Date pendingHong Zhang, Barry Smith, Satish Balay +4High-Performance ComputingCode Generation