Training Data Attribution

Latest papers 60

All topics
CardsList
  1. TICDA: Tabular In-Context Data Attribution

    Oct 6, 2026Yacine Benihaddadene, Milan Bhan, Eliot Dugelay +4Tabular Foundation ModelsTabular ICL

  2. Distilling Diffusion Score Discrepancy for Efficient Training Data Attribution

    Sep 30, 2026Shixuan Liu, Joan Serrà, Kin Wai Cheuk +6Gradient-Based AttributionTraining Data Attribution

  3. dattri-LLM: A Unified and Efficient Library for Training Data Attribution at LLM Scale

    Sep 30, 2026Shixuan Liu, Tongli Zhou, Junwei Deng +2Gradient-Based AttributionTraining Data Attribution

  4. Can Data Attribution Filter Out Subliminal Learning? Not Reliably

    Sep 17, 2026Moritz Weckbecker, Sweta Jena, Jonas Müller +5Gradient-Based AttributionTraining Data Curation

  5. Data Attribution at Scale via Influence Matrix Estimation

    Sep 14, 2026Yuxi Chen, Hamza Golubovic, Han Tong +2Influence FunctionsTraining Data Attribution

  6. Attributing Cohen's d: Training Data Attribution for Disease-Related Effects in Normative Age Biomarkers

    Sep 7, 2026Jakob Snel, Marc-Andre SchulzBrain Age PredictionInfluence Functions

  7. From Reweighting to Rewriting: Unlocking the Intervention Effects of Influential Samples in Training Data Attribution

    Sep 2, 2026Yuzhang Luo, Chenpeng Wang, Jianhui Chen +1Training Data AttributionInfluence Functions

  8. Tracing Generated Samples to Training-Data Clusters in Flow-Matching Models

    Aug 30, 2026Rania Briq, Ohad Fried, Michael Kamp +1Flow MatchingFlow-Based Generative Modeling

  9. Measuring Task-Agnostic Training Data Influence Across Language Model Pretraining

    Aug 13, 2026Yuto Nishida, Hirokazu Kiyomaru, Yusuke Oda +6Language Model PretrainingGradient-Based Attribution

  10. Auditing Data Provenance in LLM Fine-tuning via Intrinsic Distributional Fingerprints

    Aug 3, 2026Zirui Huang, Yunlong Mao, Wei Tong +3Language Model FingerprintingTraining Data Attribution

  11. How Context Attribution Handles What the Model Already Knows

    Jul 26, 2026Quoc-Huy Trinh, Lin Zhu, Sebastian SzyllerLLM EvaluationLLM Interpretability

  12. Directional Influence Function: Estimating Training Data Influence in Constrained Learning

    Jul 25, 2026Xin Wang, R. Tyrrell Rockafellar, Xuegang +1Influence FunctionsTraining Data Attribution

  13. Fisher Rank Inflation: A Spectral Signature of Memorization under Label Noise

    Jul 14, 2026Satwik Bathula, Anand A. JoshiNeural Network MemorizationNoisy-Label Learning

  14. From Neural Network Decisions to Training Cases: An Exact Account via Case-Based Decision Theory

    Jul 13, 2026Manli Yan, Yuebin Lin, Yaowen Yu +1Algorithmic AuditingNeural Network Interpretability

  15. Influence Diagnostics in High-dimensional M-estimation: Precise Asymptotics

    Jul 10, 2026Hugo CuiInfluence FunctionsTraining Data Attribution

  16. Validation-Induced Shapley Shifts: How Validation Structure Distorts Data Valuation

    Jul 4, 2026Yinan Shen, Ziao Yang, Hongfu LiuShapley Value AttributionData Valuation

  17. WARP: Weight-Space Analysis for Recovering Training Data Portfolios

    Jul 2, 2026Tzu-Heng Huang, Aditya Goyal, John Cooper +1Weight-Space AnalysisTraining Data Attribution

  18. What's a Credit Worth? A Market Framework for Attribution-Aware Compensation in Generative Music

    Jul 1, 2026Luyang Zhang, Xirui Jiang, Junwei Deng +3Mechanism DesignData Valuation