Code Generation Benchmarks

Latest papers 104

All topics
CardsList
  1. BLAST: Benchmarking LLMs with ASP-based Structured Testing

    Apr 24, 2026Manuel Alejandro Borroto Santana, Erica Coppolillo, Francesco Calimeri +3Logic ProgrammingLLM Evaluation

  2. WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models

    Apr 20, 2026Xinping Lei, Xinyu Che, Junqi Xiong +16LLM Agent EvaluationCode Language Models

  3. ACES: Who Tests the Tests? Leave-One-Out AUC Consistency for Code Generation

    Apr 5, 2026Hui Sun, Yun-Ji Zhang, Zheng Xie +4Language Model Generation EvaluationCode Generation Evaluation

  4. VectorGym: A Multi-Task Benchmark for SVG Code Generation, Sketching and Editing

    Feb 22, 2026Joan Rodriguez, Haotian Zhang, Abhay Puri +14VLM EvaluationCode Generation

  5. HardSecBench: Benchmarking the Security Awareness of LLMs for Hardware Code Generation

    Jan 20, 2026Qirui Chen, Jingxian Shuai, Shuangwu Chen +8LLM SecuritySecure Code Generation

  6. Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks

    Dec 2, 2025Songwen Zhao, Danqing Wang, Kexun Zhang +3AI Coding AgentsSoftware Security

  7. LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads?

    Oct 10, 2025Kaijian Zou, Aaron Xiong, Yunxiang Zhang +6LLM EvaluationCompetitive Programming

  8. Benchmarking Web API Integration Code Generation

    Sep 24, 2025Daniel Maninger, Leon Chemnitz, Amir Molzam Sharifloo +2Code GenerationCode Generation Evaluation

  9. BigO(Bench): Can LLMs Generate Code with Controlled Time and Space Complexity?

    Mar 19, 2025Pierre Chambon, Baptiste Roziere, Benoit Sagot +1Benchmark DesignCode Generation

  10. An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc

    Date pendingHong Zhang, Barry Smith, Satish Balay +4High-Performance ComputingCode Generation