cs.LGSep 30, 2026

TrueMuse: A Benchmark for Data Attribution in Text-to-Music Models

Authors: Jiawei Yu, Jian Liu

Organizations: School of Computing University of Georgia

Abstract

Text-to-music generation models are trained on massive music collections, creating a growing need for data attribution methods that can quantify the contribution of individual training samples. However, existing attribution methods are difficult to rigorously evaluate due to the lack of reliable ground truth, making it challenging to reliably assess their actual effectiveness. To address this gap, we introduce TrueMuse, a controlled dataset and benchmark for text-to-music data attribution. TrueMuse is constructed by fine-tuning three diffusion-based text-to-music models on carefully curated attribution samples, whose known inclusion in fine-tuning provides controlled attribution targets for evaluation. The benchmark covers four attribution settings, spanning melodic structure, timbral characteristics, artist-level stylistic signatures, and genre-level shared patterns, and includes 133 attributes, 648 fine-tuned models, and 95,456 generated samples across two prompt types. Using TrueMuse, we systematically evaluate existing black-box attribution methods along four dimensions: fine-tuning improvement, prompt-type difficulty, multi-task training, and fine-tuning data size. Our results show that attribution remains challenging, with existing methods exhibiting substantial variation across evaluation settings, highlighting the need for more reliable and generalizable attribution methods for text-to-music generation. Code and Dataset will be released upon acceptance.

Figures & tables

Appendix figures & tables15 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. Academic Text-to-Music Grand Challenge: Datasets, Baselines, and Evaluation Methods

    May 20, 2026Fang-Chih Hsieh, Wei-Jaw Lee, Chun-Ping Wang +3Text-To-Music

  2. Instrumental Text-to-Music Generation with Auxiliary Conditioning Branches

    May 20, 2026Junyoung KohText-To-Music

  3. Auditing Training Data in Generative Music Models via Black-Box Membership Inference

    May 28, 2026Yi Chen Liu, Jiawei Yu, Kexin Cao +3Text-To-MusicMembership Inference