Decide, Ask, or Defer: Clinical LLMs under Incomplete Evidence
Organizations: Department of Computer Science University of Texas at Dallas Richardson, TX 75080
Abstract
Clinical LLMs must decide not only what diagnosis to produce, but also whether the available evidence is sufficient for autonomous decision making. Binary DECIDE/ABSTAIN formulations merge distinct non decision states and do not explicitly evaluate information acquisition. We introduce a DECIDE/ASK/DEFER formulation together with a blinded protocol that prevents models from using evidence completeness metadata. We evaluate Qwen, Gemini, and GPT on 200 matched clinical evidence states constructed from DDXPlus. The models show substantial differences in action selection under identical evidence, with disagreement in 137 of 200 states. For Qwen, a matched targeted versus random analysis shows that selected information changes the likelihood of a subsequent autonomous decision more clearly than diagnostic correctness. Its matched DECIDE/ABSTAIN baseline further reveals a safety autonomy tradeoff: the three action policy rescues some erroneous autonomous decisions but also removes some correct autonomous deci sions. These results show that separating information acquisition from clinician deferral exposes behavior that binary abstention hides, without yielding a uniformly improved decision policy.
Figures & tables
| Metric | Numerator | Denominator |
|---|---|---|
| Conditional decision accuracy | Correct Decide outcomes | All Decide outcomes |
| Autonomous coverage | All Decide outcomes, correct or incorrect | All evaluated states |
| Correct autonomous coverage | Correct Decide outcomes | All evaluated states |
| Wrong decision rate | Incorrect Decide outcomes | All evaluated states |
| Unsafe premature decision rate | Incorrect Decide outcomes with evidence level | All incomplete evidence states |
| Model pair | Disagreement | Holm adjusted | |
|---|---|---|---|
| Qwen vs. Gemini | 50.5% | 93.15 | |
| Qwen vs. GPT | 61.5% | 89.00 | |
| Gemini vs. GPT | 33.5% | 46.59 |
| Metric | Targeted | Random | Diff. | 95% CI | |
|---|---|---|---|---|---|
| Post Ask Decide | 67.62% | 57.14% | +10.48 pp | [0.95, 20.00] | .052 |
| Correct Decide | 43.81% | 38.10% | +5.71 pp | [-2.86, 14.29] | .263 |
| Conditional accuracy | 64.79% | 66.67% | -1.88 pp | ||
| Defer | 32.38% | 42.86% | -10.48 pp |
Appendix figures & tables12 assets
Supplementary material from the paper’s appendix.
Appendix
| Setting | Value |
|---|---|
| Qwen provider | Groq |
| Qwen model ID | qwen/qwen3.8 27b |
| Qwen temperature | 0 |
| Qwen output limit | Provider default |
| Qwen other settings | Top and reasoning settings were not explicitly set. |
| Gemini provider | Vertex AI |
| Analysis | Targeted DECIDE | Random DECIDE | Targeted correct | Random correct |
|---|---|---|---|---|
| All pairs ( ) | 67.62% | 57.14% | 43.81% | 38.10% |
| Distinct items ( ) | 62.96% | 49.38% | 43.21% | 35.80% |
| Outcome | Count | Rate |
|---|---|---|
| Targeted win | 16 | 19.75% |
| Tie | 49 | 60.49% |
| Targeted loss | 16 | 19.75% |
| Agreement pattern | Count | Rate |
|---|---|---|
| All three models agree | 63 | 31.5% |
| Exactly two models agree | 120 | 60.0% |
| All three models differ | 17 | 8.5% |
| Any disagreement | 137 | 68.5% |
| Model pair | Disagreement | 95% CI |
|---|---|---|
| Qwen vs. Gemini | 50.5% | [42.5, 59.0] |
| Qwen vs. GPT | 61.5% | [53.5, 69.0] |
| Gemini vs. GPT | 33.5% | [25.0, 42.5] |
| Model pair | df | Holm adjusted | |
|---|---|---|---|
| Qwen vs. Gemini | 93.15 | 2 | |
| Qwen vs. GPT | 89.00 | 2 | |
| Gemini vs. GPT | 46.59 | 2 |
| Model pair | Decide | Ask | Defer |
|---|---|---|---|
| Qwen Gemini | |||
| Qwen GPT | |||
| Gemini GPT |
| Model pair | Action | Raw | Holm adjusted |
|---|---|---|---|
| Qwen vs. Gemini | Decide | ||
| Qwen vs. Gemini | Ask | ||
| Qwen vs. Gemini | Defer | ||
| Qwen vs. GPT | Decide | ||
| Qwen vs. GPT | Ask | ||
| Qwen vs. GPT | Defer |
| Qwen | Gemini | GPT | Count |
|---|---|---|---|
| Ask | Decide | Decide | 45 |
| Defer | Decide | Decide | 21 |
| Ask | Ask | Defer | 19 |
| Initial evidence | Decide | Abstain |
|---|---|---|
| 25% | 21 | 29 |
| 50% | 33 | 17 |
| 75% | 39 | 11 |
| 100% | 44 | 6 |
| Overall | 137 | 63 |
| Metric | Value |
|---|---|
| Autonomous coverage | 68.5% |
| Abstain rate | 31.5% |
| Conditional decision accuracy | 76.64% |
| Correct autonomous coverage | 52.5% |
| Wrong decision rate | 16.0% |
| Unsafe premature decision rate | 15.33% |
| Metric | Binary | Three action | Difference |
|---|---|---|---|
| Autonomous coverage | 68.5% | 54.0% | pp |
| Correct autonomous coverage | 52.5% | 39.0% | pp |
| Wrong decision rate | 16.0% | 15.0% | pp |