quant-phSep 28, 2026

QC-Stark: A Multi-Task Benchmark Revealing Capability Dissociations in LLMs Evaluated on Quantum Computing Tasks

Authors: Pranav Gupta

Organizations: Cisco, 2901 3rd Ave, Suite 600, Seattle, WA 98121, USA

Abstract

We introduce QC-Stark, a benchmark for evaluating large language models (LLMs) on 11 quantum computing (QC) tasks, spanning circuit construction, debugging, compilation, error correction, and simulation. Across 2,750 evaluations (10 models ×\times 11 tasks x 5 difficulty levels x 5 seeds), we find that overall rankings mask substantial per-task variation. The Spearman correlation between overall and per-task rankings is statistically insignificant for 4 out of the 11 tasks included in this benchmark. A 2-parameter Item Response Theory (IRT) model validates measurement quality, and prompt sensitivity analysis confirms ranking robustness across prompt conditions. All tasks are auto-verifiable via execution, thus not requiring any manual evaluation. We make the code and data publicly available on Huggingface.

Explore similar work

CardsList
  1. Benchmarking API Drift in LLM-Generated Quantum Code Across Successive SDK Versions

    Jul 5, 2026Mohammad Arif Rasyidi, Syahirul FaizQuantum Error CorrectionVersion

  2. Separating quantum circuits from classical LLMs

    Aug 4, 2026Srinivasan Arunachalam, Arkopal Dutt, Hari Krovi +1Quantum CircuitsLarge Language Model Quantization