Constitution-Guided Watermarking
Organizations: MBZUAI, Abu Dhabi, United Arab Emirates
Abstract
Watermarking enables language model providers to identify text generated by their models. However, its desired properties can conflict (\ie~stronger watermark signals can degrade text quality), while designs that resist editing may also facilitate forgery. Providers address these trade-offs by choosing configurations that balance competing objectives or prioritize particular properties. Either approach imposes a shared operating point on requests with different requirements, potentially sacrificing quality where wording preservation matters or robustness where reliable attribution is essential. To allow flexible and adaptable designs, we introduce \emph{Constitution-Guided Watermarking}, a framework that selects request-appropriate trade-offs from provider requirements, listed as natural-language principles. \emph{Offline}, a pretrained reasoning agent examines constitutional rules alongside watermark implementations and iteratively refines rule-specific configurations using empirical feedback. \emph{At deployment}, a separate monitor identifies applicable rules and retrieves the corresponding policy, including watermarking exemptions, without modifying the serving model. Furthermore, our framework supports offline parallel optimization and refinement of rule-specific configurations based on evolving provider requirements without affecting deployment, and binds each deployed configuration to its evaluation evidence, making deployment decisions auditable. In a proof-of-concept evaluation using KGW and a five-rule constitution, our framework selects configurations responsive to provider priorities and improves post-paraphrase detection on robustness-prioritized requests by up to percentage points over fixed configurations, while matching or exceeding all baselines in aggregate quality and clean detection at a nominal false-positive rate.
Figures & tables
| Input: , constitution , source , legal domains , frozen , , budget | |
| Output: policy with measured incumbents and gate status | |
| 1 | watermarked profiles; for every |
| Refine configurations using reference-set feedback. | |
| 2 | for while do |
| 3 | |
| Reject illegal configurations before generation. |
| Input: , prompt , constitution , evidence index for policy , frozen | |
| Identify applicable rules and resolve overlapping requirements. | |
| 1 | |
| 2 | |
| 3 | |
| Use the provider’s fallback when no authorized policy can be applied. | |
| 4 | if uncertain, missing, or unauthorized then return ProviderFallback |
| Scenario | Action | Constitutional priority |
|---|---|---|
| Misuse-prone requests | WM | Robustness over quality |
| Low-risk editing | NoWM | No watermark application |
| High-stakes advice | WM | Quality, low distortion, high detection |
| Deterministic answers | WM | Quality and detectability |
| General generation | WM | Minimize unnecessary distortion |
| Clean Detection | Quality | Robustness ( ) | Compliance | |||
| Method | PPL | DIAA | DIPPER | Exempt | ||
| Fixed baselines | ||||||
| Fixed KGW A | 00 0.0 | |||||
| Fixed KGW B | 00 0.0 | |||||
| Constitutional framework | ||||||
| Random-search verifier | ||||||
| Reference-set measure | Initial | Final |
|---|---|---|
| KGW bias, | 3 | 6 |
| Clean detection ( ) | 0 90.0 | 100.0 |
| Quality pass rate | 100.0 | 100.0 |
| Worst-channel robustness | 00 0.0 | 0 10.0 |
| Policy status | – | Best-effort |
| Clean Detection | Quality | Robustness ( ) | ||||
|---|---|---|---|---|---|---|
| Constitution | PPL | DIAA | DIPPER | |||
| Quality-first | ||||||
| Robustness-first | ||||||
| Balanced | ||||||
| Rule | Clean Detection | Quality | Robustness ( ) | Policy Action | Routing | |||
|---|---|---|---|---|---|---|---|---|
| Router Policy | Assignment | PPL | DIAA | DIPPER | Compliance | Failures (/500) | ||
| gpt-5-nano (low reasoning) | 0 | 0 | 36 | |||||
| gpt-5.4-nano (high reasoning) | 100.0 | 98.0 | 97.5 | 98.0 | 13.8 | 17.0 | 100.0 | 0 0 |
Appendix figures & tables8 assets
Supplementary material from the paper’s appendix.
Appendix
| Rule (priority) | Reasoning verifier (C-KGW) | Random-search verifier |
|---|---|---|
| Misuse (robustness over quality) | ||
| Editing (exempt) | NoWM | NoWM |
| Advice (quality, low distortion) | ||
| Deterministic (quality, detection) | ||
| General (minimize distortion) |
| Nominal | Nominal | ||||
|---|---|---|---|---|---|
| Detector / Use | Observed FPR | Observed FPR | |||
| Fixed KGW A | 2.531 | 3.408 | |||
| Fixed KGW B | 2.776 | 3.842 | |||
| Reasoning: non-misuse | 2.776 | 3.842 | |||
| Reasoning: misuse | 2.371 | 3.208 | |||
| Random search: deterministic | 2.967 | 4.111 | |||
| Robustness ( ) | ||
|---|---|---|
| Method | DIAA | DIPPER |
| Fixed KGW A | ||
| Fixed KGW B | ||
| Random-search verifier | ||
| Reasoning verifier (C-KGW, ours) | ||
| Nominal FPR | Attack | Reasoning | Random search | Difference |
|---|---|---|---|---|
| DIAA | 13.8 | 12.2 | ||
| DIPPER | 17.0 | 11.6 | ||
| DIAA | 27.8 | 26.6 | ||
| DIPPER | 30.8 | 28.2 |
| Probe set | Expected route | Correct route (%) | |
|---|---|---|---|
| Misuse framed as editing: corpus prompts | Misuse WM | 8 | |
| Misuse framed as editing: generated probes | Misuse WM | 42 | |
| Misuse framed as editing: all | Misuse WM | 50 | |
| Editing-only controls (corpus) | Editing NoWM | 50 |
| Monitor | Prompts | Correct rule (%) | Correct decision (%) | Failures | |
|---|---|---|---|---|---|
| gpt-5-nano (low) | Overlapping | 97 | 93.8 | 4 | |
| Single-rule | 403 | 88.6 | 32 | ||
| All | 500 | 89.6 | 36 | ||
| gpt-5.4-nano (high) | Overlapping | 97 | 97.9 | 0 | |
| Single-rule | 403 | 99.0 | 0 | ||
| All | 500 | 98.8 | 0 |