TRACE: Single-Pass Decoding-Trace Risk Localization for Generation Calibration
Organizations: The Hong Kong University of Science and Technology (Guangzhou)
Abstract
Reliable confidence estimation is essential for large language model deployment. However, answer-level calibration remains challenging because generation errors are often localized: a response may be fluent and high-probability overall while still failing at a critical number, entity, or factual claim. Existing estimators compress token probabilities, sequence likelihoods, entropy, or beam statistics into a global score, which can dilute such local risk signals. We propose TRACE, a single-pass, decoded-answer-preserving confidence estimator that treats decoding-time uncertainty as a trajectory through three steps: (i) recording token-level surprisal and predictive entropy during decoding, (ii) applying local risk operators to preserve uncertainty spikes, and (iii) converting localized trace risk into answer-level confidence. TRACE produces a label-free risk score, while TRACE+ calibrates trace-only features into probabilities using a held-out split, without extra generations or external verifiers. We evaluate four tasks against 19 calibration baselines, and TRACE+ reduces Brier from 0.149 to 0.137 and improves AUROC from 0.758 to 0.792 over the strongest likelihood baseline. Across seven LLMs, TRACE+ improves over the best non-TRACE baseline pool from 0.136 to 0.120 Brier and from 0.764 to 0.817 AUROC. Results show that localizing decoding-time risk provides a general approach to calibration.
Figures & tables
| Method | MLQA | SVAMP | TriviaQA | TruthfulQA | Avg. | |||||
| Brier | AUROC | Brier | AUROC | Brier | AUROC | Brier | AUROC | Brier | AUROC | |
| Token- and sequence-level confidence baselines | ||||||||||
| First-Token Prob ( Chen et al., 2026 ) | 0.230 | 0.580 | 0.211 | 0.721 | 0.188 | 0.806 | 0.094 | 0.590 | 0.181 | 0.674 |
| MeanProb ( Flores et al., 2025 ) | 0.228 | 0.692 | 0.196 | 0.782 | 0.206 | 0.774 | 0.094 | 0.615 | 0.181 | 0.716 |
| Len-Norm LogP ( Bakman et al., 2024 ) | 0.226 | 0.694 | 0.192 | 0.778 | 0.198 | 0.783 | 0.094 | 0.619 | 0.178 | 0.719 |
| SeqLogP / Total NLL ( Aichberger et al., 2026 ) | 0.174 | 0.812 | 0.146 | 0.791 | 0.182 | 0.811 | 0.093 | 0.619 | 0.149 | 0.758 |
| Model | Avg. Acc. | Best Non-TRACE | TRACE+ | Improvement | Task Wins | ||||
| Brier | AUROC | Brier | AUROC | Brier | AUROC | Brier | AUROC | ||
| Llama-3.1-8B-Instruct | 0.396 | 0.141 | 0.747 | 0.102 | 0.819 | +0.039 | +0.072 | 3/3 | 3/3 |
| Mistral-7B-Instruct-v0.3 | 0.438 | 0.160 | 0.763 | 0.146 | 0.790 | +0.014 | +0.027 | 3/3 | 2/3 |
| Phi-3.5-MoE-Instruct | 0.431 | 0.135 | 0.793 | 0.121 | 0.827 | +0.014 | +0.034 | 3/3 | 3/3 |
| Qwen2-57B-A14B | 0.371 | 0.169 | 0.714 | 0.143 | 0.819 | +0.026 | +0.105 | 3/3 | 2/3 |
| Llama-3.1-70B-Instruct | 0.592 | 0.104 | 0.819 | 0.098 | 0.844 | +0.007 | +0.024 | 3/3 | 2/3 |
| Variant | Brier | AUROC | ECE |
| TRACE (raw) | 0.182 | 0.772 | 0.163 |
| TRACE + scalar calib. | 0.154 | 0.772 | 0.092 |
| Learned | 0.140 | 0.778 | 0.054 |
| TRACE+ | 0.137 | 0.792 | 0.054 |
| Variant | Main | Cross | ||
| Brier | AUROC | Brier | AUROC | |
| TRACE+ | 0.137 | 0.792 | 0.120 | 0.817 |
| + seq. likelihood | 0.139 | 0.787 | 0.121 | 0.816 |
| w/o local entropy | 0.138 | 0.786 | 0.121 | 0.812 |
| w/o local surprisal | 0.137 | 0.792 | 0.121 | 0.815 |
| w/o trajectory slope | 0.136 | 0.792 | 0.123 | 0.808 |
| Method | Brier | AUROC |
| MARS ( Bakman et al., 2024 ) | 0.1730 | 0.7540 |
| MARS + TRACE | 0.1410 | 0.7750 |
| TokenSAR ( Duan et al., 2024 ) | 0.1740 | 0.7380 |
| TokenSAR + TRACE | 0.1410 | 0.7810 |
| TRACE+ | 0.1371 | 0.7920 |
| TRACE+ + MARS | 0.1376 | 0.7910 |
| Target | Best Non-TRACE | TRACE+ | Gain | |||
| Brier | AUROC | Brier | AUROC | Brier | AUROC | |
| MLQA | 0.264 | 0.813 | 0.347 | 0.814 | -0.083 | +0.001 |
| SVAMP | 0.144 | 0.843 | 0.140 | 0.842 | +0.004 | -0.001 |
| TriviaQA | 0.182 | 0.835 | 0.169 | 0.832 | +0.013 | -0.003 |
| TruthfulQA | 0.137 | 0.644 | 0.212 | 0.659 | -0.075 | +0.016 |
Appendix figures & tables15 assets
Supplementary material from the paper’s appendix.
Appendix
| Mean risk | Spike gap | Mean risk | Spike gap | Incorr. rate | |
| Low | Low | 313 | 0.064 | 0.023 | 0.224 |
| Low | High | 312 | 0.090 | 0.182 | 0.554 |
| Mid | Low | 313 | 0.178 | 0.102 | 0.591 |
| Mid | High | 313 | 0.189 | 0.390 | 0.843 |
| High | Low | 313 | 0.377 | 0.139 | 0.850 |
| High | High | 312 | 0.321 | 0.454 | 0.904 |
| Feature set | AUROC | Brier |
| Mean risk | ||
| Max token risk | ||
| Spike gap | ||
| Mean risk + spike gap | ||
| TRACE local features |
| Group | Features |
| Early entropy | First-3 entropy confidence |
| Global entropy | Mean entropy confidence |
| Length | Log answer length |
| Trajectory | Entropy slope |
| Local entropy | Decayed entropy confidence ( ) |
| Local surprisal | Decayed surprisal confidence ( ) |
| Method | Same | Single | Extra | Sem. | Calib. |
| Likelihood / entropy | ✓ | ✓ | ✗ | ✗ | ✗ |
| Beam-based scores | ✓ | ✗ | ✗ | ✗ | |
| TokenSAR | ✓ | ✓ | ✗ | ✓ | ✗ |
| MARS | ✓ | ✓ | ✗ | ✓ | ✗ |
| SelfCheckGPT | ✓ | ✗ | ✓ | ✗ | |
| Semantic Entropy | ✗ | ✗ | ✓ | ✓ | ✗ |
| Model | Task | Brier comparison | AUROC comparison | ||||||
| Best estimator | Base | TRACE+ | Best estimator | Base | TRACE+ | ||||
| Llama-3.1-8B | SVAMP | High-Prob Token Rate | 0.134 | 0.064 | +0.071 | Mean Token Entropy | 0.939 | 0.974 | +0.035 |
| TriviaQA | First-Token Prob. | 0.161 | 0.158 | +0.003 | First-Token Prob. | 0.798 | 0.801 | +0.003 | |
| TQA-Gen | First-Token Prob. | 0.088 | 0.085 | +0.003 | First-Token Prob. | 0.646 | 0.683 | +0.037 | |
| Mistral-7B | SVAMP | SeqLogP / Total NLL | 0.190 | 0.178 | +0.012 | TokenSAR | 0.824 | 0.808 | -0.016 |
| TriviaQA | First-Token Prob. | 0.180 | 0.165 | +0.015 | Max Token Entropy | 0.799 | 0.823 | +0.024 | |
| Method | Req. | Brier | AUROC |
| MARS | – | 0.173 | 0.754 |
| TokenSAR | – | 0.174 | 0.738 |
| LARS | L | 0.157 | 0.758 |
| P(True) | E | 0.178 | 0.715 |
| Verbalized conf. | E | 0.183 | 0.697 |
| Internal-state probe | H+L | 0.159 | 0.766 |
| Model | Best Non-TRACE for Brier | Best Non-TRACE for AUROC | TRACE+ | |||||
| Estimator | Brier | Brier | Estimator | AUROC | AUROC | Brier | AUROC | |
| Llama-3.1-8B-Instruct | High-Prob Token Rate | 0.141 | +0.039 | Mean Token Entropy | 0.747 | +0.072 | 0.102 | 0.819 |
| Mistral-7B-Instruct-v0.3 | SeqLogP / Total NLL | 0.160 | +0.014 | TokenSAR | 0.763 | +0.027 | 0.146 | 0.790 |
| Phi-3.5-MoE-Instruct | SeqLogP / Total NLL | 0.135 | +0.014 | SeqLogP / Total NLL | 0.793 | +0.034 | 0.121 | 0.827 |
| Qwen2-57B-A14B | SeqLogP / Total NLL | 0.169 | +0.026 | Max Token Entropy | 0.714 | +0.105 | 0.143 | 0.819 |
| Llama-3.1-70B-Instruct | SeqLogP / Total NLL | 0.104 | +0.007 | SeqLogP / Total NLL | 0.819 | +0.024 | 0.098 | 0.844 |
| Method | AUROC | Localized errors | Global errors | ||||
| Loc. | Glob. | TPR@5% | TPR@10% | TPR@20% | pAUC@10% | TPR@10% | |
| SeqLogP | 0.763 | 0.767 | 0.190 | 0.395 | 0.555 | 0.572 | 0.330 |
| WindowEnt | 0.778 | 0.754 | 0.245 | 0.378 | 0.664 | 0.599 | 0.371 |
| MARS | 0.778 | 0.789 | 0.308 | 0.494 | 0.637 | 0.620 | 0.330 |
| TRACE | 0.796 | 0.796 | 0.346 | 0.471 | 0.691 | 0.618 | 0.474 |
| TRACE+ | 0.805 | 0.744 | 0.272 | 0.521 | 0.692 | 0.648 | 0.423 |
| Variant | Avg. AUROC |
| Position-decayed entropy | 0.751 |
| Local-window entropy | 0.754 |
| Length-normalized surprisal | 0.758 |
| TRACE | 0.772 |
| Learned | 0.776 |
| Param. | Values tested | Brier | AUROC |
| – | – | – | |
| – | – | – | |
| – | – | – | |
| – | – | ||
| – | – | ||
| – | – |
| Task | Original | Position-shifted |
| MLQA | 0.786 | 0.769 |
| SVAMP | 0.825 | 0.809 |
| TriviaQA | 0.835 | 0.811 |
| TruthfulQA | 0.641 | 0.630 |
| Average | 0.772 | 0.755 |
| Method | Number/ Arithmetic | Entity/ Span | Factual Claim | Overall Localized |
| SeqLogP | 0.845 | 0.801 | 0.528 | 0.757 |
| WindowEnt | 0.868 | 0.801 | 0.556 | 0.770 |
| MARS | 0.879 | 0.796 | 0.589 | 0.768 |
| TRACE | 0.871 | 0.821 | 0.569 | 0.784 |
| TRACE+ | 0.927 | 0.836 | 0.607 | 0.805 |
| Calib. | Metric | SeqLogP | WinEnt | MARS | TRACE | TRACE+ |
| 5% | Brier | 0.154 | 0.182 | 0.188 | 0.178 | 0.156 |
| AUROC | 0.758 | 0.754 | 0.754 | 0.772 | 0.739 | |
| 10% | Brier | 0.152 | 0.175 | 0.183 | 0.171 | 0.148 |
| AUROC | 0.759 | 0.756 | 0.755 | 0.773 | 0.761 | |
| 20% | Brier | 0.148 | 0.166 | 0.177 | 0.161 | 0.140 |
| AUROC | 0.762 | 0.759 | 0.757 | 0.775 | 0.778 |
| Method | ECE | Brier | AUROC | R@10 | R@50 | R@90 |
| SeqLogP | 0.036 | 0.146 | 0.826 | 0.262 | 0.352 | 0.474 |
| WinEnt | 0.058 | 0.149 | 0.826 | 0.256 | 0.357 | 0.476 |
| MARS | 0.048 | 0.159 | 0.783 | 0.242 | 0.357 | 0.479 |
| TRACE | 0.059 | 0.144 | 0.830 | 0.251 | 0.350 | 0.473 |
| TRACE+ | 0.013 | 0.134 | 0.877 | 0.239 | 0.331 | 0.474 |
| Method | Short | Medium | Long |
| SeqLogP | 0.135/0.733 | 0.151/0.761 | 0.142/0.717 |
| WinEnt | 0.144/0.737 | 0.161/0.748 | 0.154/0.740 |
| MARS | 0.157/0.710 | 0.172/0.781 | 0.172/0.752 |
| TRACE | 0.140/0.750 | 0.155/0.781 | 0.151/0.741 |
| TRACE+ | 0.128/0.761 | 0.137/0.792 | 0.136/0.758 |