On the Token Value Inequality in Efficient Reasoning
Organizations: Rochester Institute of Technology · Purdue University · MIT-IBM Watson AI Lab · University of Missouri-Kansas City · Rutgers University · Meta AI
Abstract
Chain-of-Thought reasoning has enabled large language models to achieve substantial performance gains on complex tasks. However, these gains come at the cost of dramatically increased token consumption. This raises a fundamental question: is every token in the reasoning trace equally valuable? We present a diagnostic and optimization framework grounded in a key empirical finding: the value of tokens within a CoT reasoning sequence is highly non-uniform, and this non-uniformity can be effectively characterized by token-level log probability signals. We show that normalized log probability helps distinguish core tokens, which carry structural and decisive reasoning content, from redundant tokens, which are exploratory, low-confidence filler that contributes less directly to the final answer. Building on these findings, we formulate the TokenProbe framework around two empirical findings and one claim: findings identify token value inequality first and then establish TokenProbe as a core-token proxy, and the claim introduces an efficient GRPO objective positing that selectively compressing redundant tokens can yield Pareto improvements in the accuracy-token efficiency space. Empirically, our method preserves reasoning quality while reducing the token usage by 76% of the baseline. Under matched reasoning-length budgets, we show that it can even outperform strong flagship baselines like Gemini-3.1-Pro. Homepage: https://runjia.tech/tokenprobe/.
Figures & tables
| Position | Semantic Role | Impact | |
| Token [54] (early) | First verification discovers misinterpretation | Productive | |
| Token [103] (early) | Mild self-correction | Productive | |
| Token [575] (mid) | Deep confusion with hesitation | Wasteful | |
| Token [1273] (mid-late) | Re-questions already-confirmed step | Wasteful (+700 tokens) |
| Model | Average | AIME | MATH | AMC | Olympid | |||||
| #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | |
| Closed-API Reasoning Models | ||||||||||
| GPT-5.4-Mini | 987 | 69.6 | 1714 | 36.7 | 589 | 88.6 | 1137 | 73.5 | 1232 | 56.6 |
| Claude-4.6-Sonnet | 1221 | 61.3 | 1907 | 20.0 | 801 | 86.0 | 1413 | 51.8 | 1478 | 46.1 |
| Grok-4.1-Fast | 4945 | 52.3 | 9361 | 10.0 | 1866 | 74.8 | 4017 | 43.4 | 7144 | 38.5 |
| Gemini-3.1-Pro | 1586 | 54.4 | 2020 | 10.0 | 1274 | 79.2 | 1798 | 37.3 | 1771 | 40.1 |
Appendix figures & tables59 assets
Supplementary material from the paper’s appendix.
Appendix
| Model Name | Identifier | Link |
| Qwen-0.6B | Qwen/Qwen3-0.6B | HuggingFace |
| DeepScaleR-1.5B | agentica-org/DeepScaleR-1.5B-Preview | HuggingFace |
| Qwen-4B | Qwen/Qwen3-4B | HuggingFace |
| Phi-Reasoning-4B | microsoft/Phi-4-mini-reasoning | HuggingFace |
| Qwen-8B | Qwen/Qwen3-8B | HuggingFace |
| Model Name | HF Identifier | Parameters | Link |
| Dense Models | |||
| Qwen-4B-Instruct | Qwen/Qwen3-4B-Instruct-2507 | 4B | HuggingFace |
| Qwen-9B | Qwen/Qwen3.5-9B | 9B | HuggingFace |
| DS-Qw-1B | deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B | 1.5B | HuggingFace |
| Mixture-of-Experts (MoE) Models | |||
| GPT-117B-5B | openai/gpt-oss-120b | 117B (5B) | HuggingFace |
| Model Name | API Identifier | Version | Mode | Link |
| Qwen-3.6-Plus | qwen/qwen3.6-plus | 3.6 | Plus | Blog |
| GPT-5.4-Mini | openai/gpt-5.4-mini | 5.4 | Mini | Blog |
| Grok-4.1-Fast | x-ai/grok-4.1-fast | 4.1 | Fast | Blog |
| Gemini-3-Flash | google/gemini-3-flash-preview | 3 | Flash | Blog |
| Gemini-3.1-Pro | google/gemini-3.1-pro-preview | 3.1 | Pro | Blog |
| Gemini-3.1-Flash-Lite | google/gemini-3.1-flash-lite-preview | 3.1 | Flash-Lite | Blog |
| Mode | Accuracy | Avg. Tokens |
| CoT ON ( thinking=True ) | 77.1% | 8,728 |
| CoT OFF ( thinking=False ) | 53.0% | 1,943 |
| Difference | +24.1 percentage points | +6,785 (4.5 ) |
| Model | Think TokenProbe | Answer TokenProbe | (Answer Think) |
| DS-Qw-1B | 0.716 | 0.915 | |
| Qwen-0.6B | 0.712 | 0.823 | |
| Qwen-4B | 0.775 | 0.815 | |
| Qwen-8B | 0.784 | 0.810 | |
| Qwen-9B | 0.779 | 0.878 |
| Model | TokenProbe | Avg Tokens | Avg Accuracy |
| Qwen-0.6B | 72.7% | 8,723 | 43.8% |
| DS-Qw-1B | 74.2% | 8,589 | 54.7% |
| Qwen-4B | 77.4% | 6,155 | 65.7% |
| Qwen-4B-Instruct | 83.8% | 3,573 | 71.8% |
| Model | AIME2025 | AMC | MATH | Olympiad | Overall |
| Qwen-0.6B | 13.3% | 45.8% | 75.6% | 40.6% | 43.8% |
| DS-Qw-1B | 20.0% | 66.3% | 85.0% | 47.7% | 54.7% |
| Qwen-4B | 40.0% | 74.7% | 90.4% | 57.8% | 65.7% |
| Qwen-4B-Instruct | 50.0% | 78.3% | 92.6% | 66.2% | 71.8% |
| Model | AIME2025 | AMC | MATH | Olympiad | Overall |
| Qwen-0.6B | 12,569 | 8,934 | 5,064 | 8,323 | 8,723 |
| DS-Qw-1B | 12,256 | 8,146 | 4,785 | 9,169 | 8,589 |
| Qwen-4B | 7,696 | 6,360 | 4,162 | 6,404 | 6,155 |
| Qwen-4B-Instruct | 5,721 | 3,216 | 1,548 | 3,805 | 3,573 |
| Quartile | TokenProbe range | Avg TokenProbe | Accuracy | Avg Tokens |
| Q1 | 0.690 to 0.756 | 0.736 | 61.5% | 10,555 |
| Q2 | 0.756 to 0.781 | 0.770 | 78.3% | 8,327 |
| Q3 | 0.781 to 0.804 | 0.791 | 87.0% | 6,592 |
| Q4 | 0.804 to 0.869 | 0.820 | 92.9% | 4,524 |
| Quartile | TokenProbe range | Avg TokenProbe | Accuracy | Avg Tokens |
| Q1 | 0.682 to 0.766 | 0.744 | 60.9% | 10,825 |
| Q2 | 0.766 to 0.789 | 0.779 | 77.0% | 8,637 |
| Q3 | 0.789 to 0.811 | 0.800 | 86.6% | 6,888 |
| Q4 | 0.811 to 0.990 | 0.828 | 90.4% | 5,017 |
| Quartile | TokenProbe range | Accuracy | Avg Tokens |
| Q1 | 39.1% | 9,623 | |
| Q2 | 0.688 to 0.745 | 67.7% | 7,066 |
| Q3 | 0.745 to 0.773 | 71.4% | 6,933 |
| Q4 | 72.7% | 6,271 |
| Quartile | TokenProbe range | Accuracy | Avg Tokens |
| Q1 | 32.3% | 8,048 | |
| Q2 | 0.698 to 0.731 | 45.7% | 8,310 |
| Q3 | 0.731 to 0.756 | 64.3% | 6,873 |
| Q4 | 73.3% | 5,554 |
| Setting | TokenProbe | Avg Tokens | Accuracy |
| Qwen-9B (8K context, ) | 0.780 | 7,252 | 36.8% |
| Qwen-9B (16K context, ) | 0.782 | 10,009 | 46.5% |
| Qwen-9B (16K context, ) | 0.780 | 9,303 | 45.5% |
| Model | AIME2025 | AMC | MATH | Olympiad | Overall |
| Qwen-0.6B | 0.716 | 0.729 | 0.739 | 0.726 | 0.727 |
| DS-Qw-1B | 0.732 | 0.748 | 0.748 | 0.740 | 0.742 |
| Qwen-4B | 0.764 | 0.775 | 0.786 | 0.765 | 0.774 |
| Qwen-4B-Instruct | 0.800 | 0.830 | 0.862 | 0.823 | 0.838 |
| Model | TokenProbe (Correct) | TokenProbe (Wrong) | |||
| Qwen-0.6B | 0.742 | 0.714 | 564 | 724 | |
| DS-Qw-1B | 0.757 | 0.726 | 705 | 583 | |
| Qwen-4B | 0.782 | 0.754 | 916 | 372 | |
| Qwen-4B-Instruct | 0.851 | 0.793 | 990 | 298 |
| Setting | Avg. Acc. | Avg. Tokens |
| Qwen-4B-Instruct (base, non-thinking) | ||
| Qwen-4B-Instruct + vanilla GRPO | ||
| Qwen-4B-Instruct + KL ( , ) | ||
| Qwen-4B-Instruct + KL ( , ) |
| Model | ( TokenProbe , Token Length ) | ( TokenProbe , Accuracy ) |
| DS-Qw-1.5B | ||
| Qwen-0.6B | ||
| Qwen-4B | ||
| Qwen-8B | ||
| Qwen-9B |
| Descriptor | Per-response definition |
| Log-probability distribution (absolute level) | |
| Mean log-prob | |
| Std / Var log-prob | , |
| Median / Min / Max log-prob | |
| Quartiles, IQR | |
| Skewness log-prob | |
| Signal (overall) | Qwen-0.6B | DS-Qw-1B | Qwen-4B | Qwen-4B-Instruct |
| Accuracy | 43.8% | 54.7% | 65.7% | 71.8% |
| Avg. Tokens | 8,723 | 8,589 | 6,155 | 3,573 |
| TokenProbe | 0.727 | 0.742 | 0.774 | 0.838 |
| ratio | 0.1267 | 0.1255 | 0.1089 | 0.0812 |
| Mean | 0.6892 | 0.6281 | 0.6813 | 0.5187 |
| Skewness log-prob |
| Model | AIME2025 | AMC | MATH | Olympiad | Overall |
| Qwen-0.6B | |||||
| DS-Qw-1B | |||||
| Qwen-4B | |||||
| Qwen-4B-Instruct |
| Model | AIME2025 | AMC | MATH | Olympiad | Overall |
| Qwen-0.6B | 1.3420 | 1.3088 | 1.2953 | 1.3362 | 1.3187 |
| DS-Qw-1B | 1.4144 | 1.3286 | 1.3324 | 1.3679 | 1.3526 |
| Qwen-4B | 1.2140 | 1.1895 | 1.1669 | 1.2041 | 1.1890 |
| Qwen-4B-Instruct | 1.1748 | 1.1298 | 1.0880 | 1.1472 | 1.1238 |
| Model | AIME2025 | AMC | MATH | Olympiad | Overall |
| Qwen-0.6B | 0.4422 | 0.4049 | 0.3888 | 0.4344 | 0.4150 |
| DS-Qw-1B | 0.5014 | 0.4170 | 0.4222 | 0.4561 | 0.4415 |
| Qwen-4B | 0.2802 | 0.2520 | 0.2247 | 0.2698 | 0.2514 |
| Qwen-4B-Instruct | 0.2365 | 0.1798 | 0.1237 | 0.2011 | 0.1705 |
| Dataset | Selection | Coverage | Desert100 |
| AIME | Non-overlap | ||
| Overlap | |||
| AMC | Non-overlap | ||
| Overlap |
| Dataset | Jaccard | F1 | Score gap | Time / rollout |
| AIME | ms / ms | |||
| AMC | ms / ms |
| Avg. Accuracy | ||||
| Avg. Tokens |
| Local range around | Coarse range to | ||||
| Adjacent | Adjacent | ||||
| 5 | , | 20 | |||
| 6 | 21 | ||||
| 7 | 22 | ||||
| 8 | 23 | ||||
| 9 | 24 | ||||
| Data | Mask | Score / span | Role | Excerpt around selected window |
| AIME | Core | / 455–464 | Symbolic content | “ ”, inside the derivation of odd/even digit sums. |
| AIME | Core | / 4141–4150 | Symbolic content | “ ”, inside an inclusion-exclusion count. |
| AMC | Core | / 1056–1065 | Symbolic content | “ ”, inside the expansion of . |
| AIME | Anti | / 3292–3301 | Hedging/repetition | “Wait, is there a way that this answer could be wrong?” |
| AMC | Anti | / 776–785 | Hedging/repetition | “Hmm, that seems complicated. Maybe there is another approach.” |
| AMC | Anti | / 1876–1885 | Formula/theorem | “applying logarithmic identities and simplifying the terms”, a content-bearing anti-mask example. |
| AIME-2025 | AMC | |||
| Category | Core | Anti | Core | Anti |
| Symbolic content | ||||
| Decisive reasoning | ||||
| Formula / theorem | ||||
| Boilerplate connective | ||||
| Hedging / repetition | ||||
| Model | Average | AIME | MATH | AMC | OlympiadBench | |||||
| #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | |
| Gemini-3.1-Pro (2K) | 1,586 | 54.4 | 2,020 | 10.0 | 1,274 | 79.2 | 1,798 | 37.3 | 1,771 | 40.1 |
| Gemini-3.1-Pro (8K) | 2,581 | 88.0 | 5,163 | 80.0 | 1,385 | 99.4 | 2,532 | 96.4 | 3,358 | 79.0 |
| Model | Input | Output | Output / Qwen-4B | Source |
| GPT-5.4-Mini | \0.75$ | \4.50$ | OpenAI | |
| Gemini-3.1-Pro Preview ( 200K prompt) | \2.00$ | \12.00$ | ||
| Claude-4.6-Sonnet | \3.00$ | \15.00$ | Anthropic | |
| Our Qwen-4B serving estimate | N/A | \0.10$ | Estimate |
| Backbone | Params | Base Acc. | KL Acc. | RS Acc. | RS-KL | KL #Tk. | RS #Tk. |
| Qwen-0.6B | 0.6B | 40.7 | 42.3 | 36.3 | 2,023 | 1,806 | |
| DeepScaleR-1.5B | 1.5B | 59.6 | 56.1 | 55.9 | 1,698 | 1,993 | |
| Qwen-4B | 4B | 62.4 | 61.0 | 62.3 | 1,886 | 2,026 | |
| Phi-Reasoning-4B | 4B | 59.6 | 62.0 | 62.6 | 2,919 | 2,992 | |
| Qwen-8B | 8B | 61.9 | 62.7 | 68.3 | 1,476 | 2,313 |
| Trace length | (µs) | Window sel. (µs) | Total (µs) | Frac. of GRPO step |
| Setting | Average | AIME-2025 | MATH-500 | AMC | Olympiad-Bench | ||||||
| #Tk. | Acc. | %Trunc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | |
| Qwen-4B base @ K cap | N/A | ||||||||||
| Qwen-4B base @ K hard cap ( new ) | |||||||||||
| (hard cap K base) | N/A | ||||||||||
| Qwen-4B + KL (ours) | N/A | ||||||||||
| Qwen-4B + RS (ours) | N/A | ||||||||||
| Model | Average | AIME | MATH | AMC | OlympiadBench | |||||
| #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | |
| Qwen-3.6-Plus | 18,099 | 92.2 | 30,755 | 90.0 | 9103 | 99.2 | 19,836 | 98.8 | 23,987 | 86.4 |
| Gemini-3-Flash | 4844 | 91.4 | 8332 | 93.3 | 2830 | 98.6 | 5049 | 96.4 | 6156 | 85.3 |
| Qwen3-Next-80B-3B | 8619 | 89.4 | 16,463 | 86.7 | 4202 | 98.0 | 9279 | 95.2 | 11,462 | 82.4 |
| GLM-Air-106B-12B | 12,125 | 89.0 | 22,320 | 86.7 | 6564 | 98.4 | 13,338 | 94.0 | 15,643 | 81.5 |
| Step-Flash-196B-11B | 13,907 | 87.3 | 31,432 | 90.0 | 4502 | 98.6 | 12,583 | 95.2 | 20,258 | 77.9 |
| Model | Average | AIME | MATH | AMC | OlympiadBench | |||||
| #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | |
| Qwen-3.6-Plus | 1998 | 7.8 | 1980 | 0.0 | 1961 | 18.0 | 2041 | 1.2 | 2020 | 1.5 |
| Gemini-3-Flash | 1836 | 31.1 | 2048 | 0.0 | 1647 | 51.8 | 1910 | 22.9 | 1958 | 18.1 |
| Qwen3-Next-80B-3B | 1832 | 27.7 | 2048 | 0.0 | 1636 | 49.4 | 1957 | 12.0 | 1952 | 14.8 |
| GLM-Air-106B-12B | 1979 | 10.6 | 2048 | 0.0 | 1891 | 22.2 | 2034 | 3.6 | 2035 | 3.3 |
| Step-Flash-196B-11B | 1571 | 40.9 | 2019 | 3.3 | 1213 | 65.0 | 1755 | 32.5 | 1794 | 25.8 |
| Setting | Base Model | Distill Source | Think Tags |
| S1 | Qwen3-4B [ 80 ] | Phi-4-Reasoning [ 1 ] | Yes |
| S2 | Qwen3-4B [ 80 ] | Qwen3-30B-A3B [ 80 ] | No |
| S3 | Qwen3-8B [ 80 ] | Phi-4-Reasoning [ 1 ] | Yes |
| S4 | Qwen3-8B [ 80 ] | Qwen3-30B-A3B [ 80 ] | No |
| Feature | Phi4 Data | Qwen Data |
| Sample count | 25,695 | 29,761 |
| Contains <think> tags | 100.0% | 0.0% |
| Degenerate opening patterns | 0.0% | 70.6% |
| Contains \boxed{} | 99.9% | 81.9% |
| Average compression ratio | 0.375 | 0.291 |
| Setting | AIME | AMC | MATH | Olympiad | Overall | (percentage points) |
| Qwen-4B think | 60.0% | 84.3% | 95.8% | 68.4% | 77.1% | N/A |
| Qwen-8B think | 46.7% | 80.7% | 94.4% | 68.3% | 72.5% | N/A |
| Qwen-4B nothink | 20.0% | 57.8% | 85.0% | 49.0% | 53.0% | N/A |
| S1 (4B + Phi4) | 3.3% | 28.9% | 58.2% | 25.0% | 37.6% | |
| S2 (4B + Qwen) | 3.3% | 18.1% | 42.0% | 16.6% | 26.2% | |
| S3 (8B + Phi4) | 13.3% | 24.1% | 60.2% | 26.4% | 39.1% |
| Setting | Accuracy | Avg. Tokens | Efficiency (acc%/ktok) |
| Qwen3-4B think (RL) | 77.1% | 8,728 | 8.83 |
| Qwen3-8B think (RL) | 72.5% | 9,244 | 7.84 |
| S1 (4B + Phi4) | 37.6% | 4,822 | 7.80 |
| S2 (4B + Qwen) | 26.2% | 7,258 | 3.62 |
| S3 (8B + Phi4) | 39.1% | 4,161 | 9.39 |
| S4 (8B + Qwen) | 31.8% | 6,127 | 5.18 |
| Model | Correct TokenProbe | Incorrect TokenProbe | ||
| 4B think (RL baseline) | 0.784 | 0.762 | ||
| 8B think (RL baseline) | 0.790 | 0.774 | ||
| S1 (4B + Phi4) | 0.810 | 0.891 | ||
| S2 (4B + Qwen) | 0.800 | 0.878 | ||
| S3 (8B + Phi4) | 0.789 | 0.883 | ||
| S4 (8B + Qwen) | 0.782 | 0.852 |
| Setting | Category | lp_std | ZC/100tok | Max pos. run | 2nd-half TokenProbe |
| S1 | Correct ( =10) | 0.398 | 22.8 | 124 | 0.854 |
| S1 | Incorrect ( =30) | 0.240 | 12.0 | 7,522 | 0.920 |
| S3 | Correct ( =11) | 0.440 | 24.0 | 74 | 0.824 |
| S3 | Incorrect ( =29) | 0.276 | 12.6 | 7,811 | 0.915 |
| S4 | Correct ( =7) | 0.454 | 24.6 | 545 | 0.823 |
| S4 | Incorrect ( =33) | 0.353 | 15.0 | 7,096 | 0.911 |
| Setting | Tokens | TokenProbe | Behavior |
| S1 (4B+Phi4) | 451 | 0.885 | Compact think section. Factorization sum correct answer |
| S2 (4B+Qwen) | 8,192 | 0.894 | Empty think correct reasoning initially, then enters infinite loop. “284’s sum of proper divisors is 220. 220’s sum of proper divisors is 284.” repeated until truncation |
| S3 (8B+Phi4) | 484 | 0.872 | Think section present, correct approach, but arithmetic error. Sums 220’s divisors to 234 instead of 284 |
| S4 (8B+Qwen) | 8,192 | 0.948 | Empty think “This is a complex or challenging question…” brute-force enumeration checking every integer from 4 to 365 truncated |
| Domain | Base | w/ KL | w/ RS |
| Math | 0.782 | 0.887 | 0.846 |
| General | 0.736 | 0.846 | 0.802 |
| Model | Average | AIME | MATH | AMC | Olympiad |
| Qwen-0.6B w/ KL | 0.90 | 1.96 | 1.70 | 1.83 | 0.95 |
| Qwen-4B w/ RS | 0.20 | 5.10 | 1.01 | 3.17 | 1.85 |
| Backbone | Hardware | Average training time |
| Qwen-0.6B | H100 80GB | 12h 14m |
| DeepScaleR-1.5B | H100 80GB | 9h 10m |
| Qwen-4B | H100 80GB | 21h 56m |
| Phi-Reasoning-4B | H100 80GB | 25h 13m |
| Qwen-8B | H100 80GB | 38h 20m |
| Asset | Identifier / source | License / terms | Role |
| DeepScaleR-Preview-Dataset | agentica-org/DeepScaleR-Preview-Dataset | MIT | Training data |
| Qwen family | Qwen/Qwen3-* , Qwen/Qwen3.5-* , and Qwen/Qwen3-Next-* | Apache-2.0 | Training and open baselines |
| DeepScaleR-1.5B | agentica-org/DeepScaleR-1.5B-Preview | MIT | Training backbone |
| Phi-4-mini-reasoning | microsoft/Phi-4-mini-reasoning | MIT | Training backbone |
| DeepSeek-R1-Distill-Qwen | deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B | MIT | Open baseline |
| GPT-OSS | openai/gpt-oss-120b | Apache-2.0 | Open baseline |
| Asset | Identifier / source | License / terms | Role |
| DeepScaleR-Preview-Dataset | agentica-org/DeepScaleR-Preview-Dataset | MIT | Training data |
| Qwen family | Qwen/Qwen3-* , Qwen/Qwen3.5-* , and Qwen/Qwen3-Next-* | Apache-2.0 | Training and open baselines |
| DeepScaleR-1.5B | agentica-org/DeepScaleR-1.5B-Preview | MIT | Training backbone |
| Phi-4-mini-reasoning | microsoft/Phi-4-mini-reasoning | MIT | Training backbone |
| DeepSeek-R1-Distill-Qwen | deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B | MIT | Open baseline |
| GPT-OSS | openai/gpt-oss-120b | Apache-2.0 | Open baseline |
| Dataset | Token deletion | Attention-key masking |
| MATH | 2.6% / 1.1% / 0.8% | 2.4% / 0.8% / 0.3% |
| OlympiadBench | 1.8% / 0.7% / 0.5% | 1.5% / 0.6% / 0.4% |
| Model Name | API Identifier | Version | Mode | Output price | Official link |
| OpenAI | |||||
| GPT-4o | gpt-4o | 4o | Default | $10.00 | Announcement |
| OpenAI o1 | o1 | o1 | Reasoning | $60.00 | Announcement |
| OpenAI o3 | o3 | o3 | Reasoning | $8.00 | Announcement |
| GPT-5.2 Pro | gpt-5.2-pro | 5.2 | Pro | $168.00 | Announcement |
| GPT-5.4 Mini | gpt-5.4-mini | 5.4 | Mini | $4.50 | Announcement |
| Model | Average | AIME-2025 | MATH-500 | AMC | OlympiadBench | |||||
| #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | |
| Previously reported closed-API baselines | ||||||||||
| GPT-5.4-Mini | 987 | 69.6 | 1,714 | 36.7 | 589 | 88.6 | 1,137 | 73.5 | 1,232 | 56.6 |
| Claude-4.6-Sonnet | 1,221 | 61.3 | 1,907 | 20.0 | 801 | 86.0 | 1,413 | 51.8 | 1,478 | 46.1 |
| Grok-4.1-Fast | 4,945 | 52.3 | 9,361 | 10.0 | 1,866 | 74.8 | 4,017 | 43.4 | 7,144 | 38.5 |
| Gemini-3.1-Pro | 1,586 | 54.4 | 2,020 | 10.0 | 1,274 | 79.2 | 1,798 | 37.3 | 1,771 | 40.1 |
| Model | Average | MMLU | MMLU-Pro | LSAT | GPQA | |||||
| #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | |
| Previously reported closed-API baselines | ||||||||||
| Grok-4.1-Fast | 2,892 | 88.2 | 1,026 | 90.9 | 2,288 | 84.1 | 2,797 | 96.1 | 5,459 | 81.8 |
| Claude-4.5-Haiku | 1,090 | 72.0 | 706 | 88.6 | 883 | 79.8 | 1,521 | 54.8 | 1,250 | 64.7 |
| Gemini-3.1-Pro | 1,294 | 68.6 | 681 | 92.8 | 1,055 | 80.3 | 1,727 | 54.4 | 1,714 | 47.0 |
| Claude-4.6-Sonnet | 1,290 | 57.1 | 645 | 88.8 | 965 | 73.0 | 1,797 | 35.7 | 1,754 | 30.8 |
| Model | Average | AIME | MATH | AMC | Olympid | |||||
| #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | |
| Closed-API Reasoning Models | ||||||||||
| Claude-4.6-Opus | 1,130 | 70.0 | 1,852 | 30.0 | 689 | 93.2 | 1,375 | 65.1 | 1,395 | 55.1 |
| Claude-4.5-Haiku | 1,339 | 72.0 | 1,803 | 23.3 | 1,061 | 89.8 | 1,533 | 66.3 | 1,500 | 61.6 |
| Gemini-3.1-Flash-Lite | 778 | 80.4 | 1,036 | 36.7 | 614 | 94.6 | 893 | 81.9 | 875 | 71.6 |
| Open Source Reasoning Models | ||||||||||
| Model | Average | AIME | MATH | AMC | OlympiadBench | |||||
| #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | |
| Qwen-3.6-Plus | 15,207 | 80.0 | 25,812 | 56.7 | 8812 | 96.2 | 18,520 | 90.4 | 19,065 | 67.7 |
| Gemini-3-Flash | 4844 | 91.4 | 8332 | 93.3 | 2830 | 98.6 | 5049 | 96.4 | 6156 | 85.3 |
| Qwen3-Next-80B-3B | 8472 | 88.0 | 16,183 | 83.3 | 4185 | 97.8 | 9193 | 92.8 | 11,216 | 80.4 |
| GLM-Air-106B-12B | 11,278 | 86.1 | 20,859 | 83.3 | 6517 | 97.8 | 13,257 | 92.8 | 14,136 | 76.7 |
| Step-Flash-196B-11B | 10,147 | 80.2 | 23,018 | 56.7 | 4124 | 97.0 | 10,868 | 88.0 | 13,949 | 67.9 |
| Model | Average | AIME | MATH | AMC | OlympiadBench | |||||
| #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | |
| Qwen-3.6-Plus | 10,678 | 55.9 | 15,472 | 10.0 | 7432 | 80.4 | 13,440 | 42.2 | 12,530 | 41.5 |
| Gemini-3-Flash | 4802 | 90.4 | 8332 | 93.3 | 2830 | 98.6 | 4989 | 95.2 | 6083 | 83.6 |
| Qwen3-Next-80B-3B | 7045 | 77.3 | 12,568 | 56.7 | 3988 | 95.2 | 8334 | 83.1 | 8905 | 64.3 |
| GLM-Air-106B-12B | 8831 | 71.7 | 14,191 | 40.0 | 5970 | 90.4 | 10,837 | 71.1 | 10,465 | 59.3 |
| Step-Flash-196B-11B | 6692 | 71.7 | 13,740 | 33.3 | 3338 | 92.0 | 7752 | 72.3 | 8734 | 58.2 |
| Model | Average | AIME | MATH | AMC | OlympiadBench | |||||
| #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | |
| Qwen-3.6-Plus | 6492 | 38.5 | 7919 | 0.0 | 5196 | 64.8 | 7500 | 19.3 | 7265 | 23.1 |
| Gemini-3-Flash | 4106 | 73.8 | 6515 | 53.3 | 2673 | 92.4 | 4286 | 78.3 | 5039 | 60.3 |
| Qwen3-Next-80B-3B | 4991 | 60.2 | 7722 | 16.7 | 3326 | 83.0 | 6111 | 56.6 | 5965 | 45.8 |
| GLM-Air-106B-12B | 6033 | 49.6 | 7988 | 10.0 | 4711 | 72.8 | 7038 | 33.7 | 6801 | 36.1 |
| Step-Flash-196B-11B | 4245 | 63.2 | 7484 | 16.7 | 2527 | 85.2 | 5022 | 57.8 | 5279 | 49.6 |
| Model | Average | AIME | MATH | AMC | OlympiadBench | |||||
| #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | |
| Qwen-3.6-Plus | 3727 | 21.0 | 3959 | 0.0 | 3361 | 43.2 | 3986 | 7.2 | 3957 | 7.3 |
| Gemini-3-Flash | 2860 | 58.6 | 3885 | 20.0 | 2217 | 82.2 | 3038 | 54.2 | 3269 | 43.4 |
| Qwen3-Next-80B-3B | 3101 | 42.8 | 4096 | 0.0 | 2391 | 69.2 | 3590 | 25.3 | 3522 | 27.3 |
| GLM-Air-106B-12B | 3606 | 28.3 | 4096 | 0.0 | 3179 | 49.0 | 3875 | 16.9 | 3867 | 15.7 |
| Step-Flash-196B-11B | 2619 | 53.4 | 3962 | 10.0 | 1784 | 76.2 | 3004 | 45.8 | 3131 | 39.4 |
| Model | Average | AIME | MATH | AMC | OlympiadBench | |||||
| #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | |
| Qwen-3.6-Plus | 1016 | 0.1 | 990 | 0.0 | 1021 | 0.2 | 1024 | 0.0 | 1012 | 0.0 |
| Gemini-3-Flash | 1008 | 6.9 | 1024 | 0.0 | 986 | 16.4 | 1022 | 1.2 | 1023 | 0.9 |
| Qwen3-Next-80B-3B | 1007 | 7.6 | 1024 | 0.0 | 987 | 16.0 | 1021 | 3.6 | 1020 | 2.2 |
| GLM-Air-106B-12B | 1020 | 2.4 | 1024 | 0.0 | 1015 | 5.8 | 1024 | 0.0 | 1024 | 0.3 |
| Step-Flash-196B-11B | 912 | 25.8 | 1024 | 0.0 | 794 | 48.6 | 982 | 13.3 | 985 | 11.6 |
| Model | Average | MMLU | MMLU-Pro | LSAT | GPQA | |||||
| #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | #Tk. | Acc. | |
| Closed-API Reasoning Models | ||||||||||
| Grok-4.1-Fast | 2892 | 88.2 | 1026 | 90.9 | 2288 | 84.1 | 2797 | 96.1 | 5459 | 81.8 |
| Claude-4.5-Haiku | 1090 | 72.0 | 706 | 88.6 | 883 | 79.8 | 1521 | 54.8 | 1250 | 64.7 |
| Gemini-3.1-Pro | 1294 | 68.6 | 681 | 92.8 | 1055 | 80.3 | 1727 | 54.4 | 1714 | 47.0 |
| Claude-4.6-Sonnet | 1290 | 57.1 | 645 | 88.8 | 965 | 73.0 | 1797 | 35.7 | 1754 | 30.8 |