Who Wrote the Book? Detecting and Attributing LLM Ghostwriters
Organizations: School of Computing and Information Systems, The University of Melbourne, Australia · School of Computing, FSE, Macquarie University, Australia
Abstract
In this paper, we introduce GhostWriteBench, a dataset for LLM authorship attribution. It comprises long-form texts (50K+ words per book) generated by frontier LLMs, and is designed to test generalisation across multiple out-of-distribution (OOD) dimensions, including domain and unseen LLM author. We also propose TRACE -- a novel fingerprinting method that is interpretable and lightweight -- that works for both open- and closed-source models. TRACE creates the fingerprint by capturing token-level transition patterns (e.g., word rank) estimated by another lightweight language model. Experiments on GhostWriteBench demonstrate that TRACE achieves state-of-the-art performance, remains robust in OOD settings, and works well in limited training data scenarios.
Figures & tables
| Dataset | Task | LLM Generators | OOD | Long | Avg. | Num. | ||
| Type | Num. | Frontier † | Domain | Author | Form | Length | Docs | |
| TuringBench | Multi | 20 | ✗ | ✗ | ✗ | ✗ | <200 | 160K |
| MGTBench | Binary | 6 | ✗ | ✗ | ✗ | ✗ | <500 | 21K |
| RAID | Binary | 11 | ✗ | ✓ | ✗ | ✗ | <250 | 500K |
| M4GT-Bench | Multi | 6 | ✗ | ✓ | ✗ | ✗ | <500 | 87K |
| OpenTuring | Multi | 7 | ✗ | ✓ | ✗ | ✗ | <500 | 497K |
| Model | Total | Avg. # | Text Quality and Diversity | ||||
| Books | Words | PPL ( ) | S-B ( ) | S-R ( ) | NGD ( ) | CR ( ) | |
| deepseek-chat | K | ||||||
| glm-4.6 | K | ||||||
| kimi-k2 | K | ||||||
| qwen3-235b | K | ||||||
| qwen3-max | K | ||||||
| Method | Low Resource | High Resource | ||||
| ID | OOD-Domain | OOD-Author | ID | OOD-Domain | OOD-Author | |
| Rank | ||||||
| Entropy | ||||||
| GLTR | ||||||
| n-gram | ||||||
| Bert-AA | ||||||
| Method | OOD-Author | |
| LLM | Human | |
| n-gram | ||
| DeTeCtive | ||
| TRACE (Ours) | ||
| Ranks-JS | ||
| Entropy-JS | ||
Appendix figures & tables31 assets
Supplementary material from the paper’s appendix.
Appendix
| Code | Genre |
| LF | Literature & Fiction |
| HB | History & Biographies |
| BLP | Business, Law & Politics |
| ST | Science & Technology |
| ACM | Art, Culture & Media |
| SSP | Social Sciences & Philosophy |
| LLM | Book Generation | |||
| Steps | Outline | Segment | Total | |
| deepseek-chat | K | K | K | |
| glm-4.6 | K | K | K | |
| kimi-k2 | K | K | K | |
| qwen3-235b | K | K | K | |
| qwen3-max | K | K | K | |
| LLM | Genre | Passage-level | Overall | ||||||||
| Rel. | Eng. | Coh. | Flu. | Div. | Coh. | Emp. | Sur. | Eng. | Comp. | ||
| deepseek-chat | SSP | ||||||||||
| glm-4.6 | HB,SSP,JR | ||||||||||
| kimi-k2 | LF | ||||||||||
| qwen3-235b | SSP,LF | ||||||||||
| qwen3-max | LHH,ST | ||||||||||
| LLM | API Cost (1$ M) | Total | |
| Input | Output | (in $) | |
| deepseek-chat | |||
| glm-4.6 | |||
| kimi-k2 | |||
| qwen3-235b | |||
| qwen3-max | |||
| Model Name | OpenRouter Checkpoint | Context | Max. Out. | Type | Reference |
| deepseek-chat | deepseek/deepseek-chat-v3-0324 | 163.8K | 163.8K | Open | DeepSeek-AI et al. (2025) |
| glm-4.6 | z-ai/glm-4.6 | 204.8K | 204.8K | Open | GLM Team et al. (2025) |
| kimi-k2 | moonshotai/kimi-k2-thinking | 131.1K | 131.1K | Open | Kimi Team et al. (2026) |
| qwen3-235b | qwen/qwen3-235b-a22b-2507 | 262.1K | 262.1K | Open | Yang et al. (2025) |
| qwen3-max | qwen/qwen3-max | 262.1K | 32.8K | Closed | Qwen Team (2026) |
| claude-sonnet | anthropic/claude-sonnet-4.5 | 1M | 64K | Closed | Anthropic (2025) |
| Model | Split | Genres | # Books |
| deepseek-chat | ID | LF | |
| OOD-Domain | LHH, HB | ||
| BLP, HB | |||
| SSP | |||
| glm-4.6 | ID | HB, SSP, JR | |
| HB, JR |
| Method | OOD-Author | |
| AUROC | AUPR | |
| Rank | ||
| Entropy | ||
| GLTR | ||
| n-gram | ||
| Bert-AA | ||
| Method | n-gram | Bert-AA | DeTeCt. | TopForm. | TRACE (Ours) | Avg. | ||
| Ranks-JS | Entropy-JS | Entropy-Norm | ||||||
| deepseek-chat | ||||||||
| glm-4.6 | ||||||||
| kimi-k2 | ||||||||
| qwen3-235b | ||||||||
| qwen3-max | ||||||||
| Method | ID | OOD-Domain | OOD-Author |
| Rank | |||
| Entropy | |||
| GLTR | |||
| n-gram | |||
| Bert-AA | |||
| TopFormer |
| Method | ID | OOD-Domain | ||||||
| Top- | Top- | Top- | Top- | Top- | Top- | Top- | Top- | |
| Rank | ||||||||
| Entropy | ||||||||
| GLTR | ||||||||
| n-gram | ||||||||
| Bert-AA | ||||||||
| Method | Low Resource | High Resource | ||
| ID | OOD-Domain | ID | OOD-Domain | |
| n-gram | ||||
| Bert-AA | ||||
| TopFormer | ||||
| DeTeCtive | ||||
| TRACE (Ours) | ||||
| Method | Low Resource | High Resource | ||
| Reject | Family | Reject | Family | |
| n-gram | ||||
| Bert-AA | ||||
| TopFormer | ||||
| DeTeCtive | ||||
| TRACE (Ours) | ||||
| Scenario | Split 1 | Split 2 | Split 3 |
| low-resource | gemini-flash | gemini-flash | gemini-pro |
| glm-4.6 | claude-sonnet | gemini-flash | |
| deepseek-chat | kimi-k2 | qwen3-235b | |
| gpt-5.1 | gpt-5.1 | qwen3-max | |
| qwen3-235b | qwen3-235b | deepseek-chat | |
| high-resource | gemini-pro | gemini-pro | glm-4.6 |
| Method | Split 1 | Split 2 | Split 3 |
| Rank | 0.30 | 0.30 | 0.35 |
| Entropy | 0.30 | 0.25 | 0.25 |
| GLTR | 0.30 | 0.30 | 0.25 |
| n-gram | 0.40 | 0.75 | 0.40 |
| Bert-AA | 0.50 | 0.50 | 0.50 |
| TopFormer | 0.60 | 0.60 | 0.70 |