Training Data Attribution

Latest papers 60

All topics
CardsList
  1. Prototype Language Models

    Jul 1, 2026Dan Ley, Giang Nguyen, Himabindu Lakkaraju +1LLM InterpretabilityLanguage Modeling

  2. Dataset Usage Inference without Shadow Models or Held-out Data

    Jun 24, 2026Wojciech Łapacz, Stanisław Pawlak, Jan Dubiński +2Training Data Attribution

  3. Quantifying the Agreement Between Data-Influence and Data-Similarity to Understand LLM Behavior

    Jun 22, 2026Christopher J. Anders, Henrique Da Silva Gameiro, Nico Daheim +1LLM AuditingLLM Interpretability

  4. Influcoder: Distilling Decoders' Gradient Influence Rankings into an Encoder for Data Attribution

    Jun 11, 2026Dimitri Kachler, Damien Sileo, Pascal DenisGradient-Based AttributionInfluence Functions

  5. Bergson: An Open Source Library for Data Attribution

    Jun 10, 2026Lucia Quirke, Louis Jaburi, David Johnston +6Gradient-Based AttributionLLM Interpretability

  6. DeMix: Debugging Training Data with Mixed Data Error Types by Investigating Influence Vectors

    Jun 10, 2026Jiale Deng, Yanyan Shen, Xiaogang Shi +1Training Data Attribution

  7. GRASP: Geometry-aware Residual Alignment for Scalable Pretraining Data Attribution

    Jun 5, 2026Yue Min, Ruining Chen, Yujun LiData SelectionTraining Data Selection

  8. STRIDE: Training Data Attribution via Sparse Recovery from Subset Perturbations

    Jun 3, 2026Rishit Dagli, Abir Harrasse, Luke Zhang +4Sparse RecoveryData Selection

  9. idSCD: Identifying Training Datasets through Semantic Correlation Descriptors

    May 28, 2026Andrada Gobeaja, Ionut Hodoroaga, Elena Burceanu +1Membership Inference AttacksTraining Data Attribution

  10. RLVR Datasets and Where to Find Them: Tracing Data Lineage for Better Training Data

    May 26, 2026Hsiu-Yuan Huang, Weijie Liu, Chenming Tang +5Data ProvenanceReinforcement Learning with Verifiable Rewards

  11. Dynamic Shapley Computation

    May 20, 2026Xuan Yang, Hsi-Wen Chen, Ming-Syan Chen +1Shapley Value AttributionData Valuation

  12. CLIF: Concept-Level Influence Functions for Transparent Bottleneck Models

    May 19, 2026Yike Sun, Mingkun Xu, Mu You +5Concept Bottleneck ModelsInfluence Functions

  13. ARIA: A Diagnostic Framework for Music Training Data Attribution

    May 15, 2026Changheon Han, Ashkan Panahi, Kıvanç TatarMusic GenerationTraining Data Attribution

  14. Interaction-Aware Influence Functions for Group Attribution

    May 15, 2026Jaeseung Heo, Kyeongheung Yun, Youngbin Choi +3Instruction-Tuning Data SelectionInfluence Functions

  15. On the Fragility of Data Attribution When Learning Is Distributed

    May 15, 2026Xian Gao, Bo Hui, Min-Te Sun +1Training Data Attribution

  16. Correcting Influence: Unboxing LLM Outputs with Orthogonal Latent Spaces

    May 12, 2026Shixing Yu, Promit Ghosal, Kyra GanFeature AttributionLLM Auditing

  17. How Faithful Is Trajectory-Based Data Attribution? Error Sources, Remedies, and Practical Guidelines

    May 12, 2026Junwei Deng, Pingbang Hu, Suliang Jin +4Gradient-Based AttributionData Selection

  18. Constraint-Data-Value-Maximization: Utilizing Data Attribution for Effective Data Pruning in Low-Data Environments

    May 11, 2026Danilo Brajovic, David A. Kreplin, Marco F. HuberDataset PruningTraining Data Selection

  19. Quotient Semivalues for False-Name-Resistant Data Attribution

    May 8, 2026Florian A. D. Burnat, Brittany I. DavidsonCybersecurityShapley Value Attribution

  20. FedAttr: Towards Privacy-preserving Client-Level Attribution in Federated LLM Fine-tuning

    May 7, 2026Su Zhang, Junfeng Guo, Heng HuangPrivacy-Preserving Language ModelsLLM Fine-Tuning

  21. DataDignity: Training Data Attribution for Large Language Models

    May 7, 2026Xiaomin Li, Andrzej Banburski-Fahey, Jaron LanierLLM AuditingInformation Retrieval

  22. From Parameter Dynamics to Risk Scoring : Quantifying Sample-Level Safety Degradation in LLM Fine-tuning

    May 6, 2026Xiao Wang, Yifei Zhang, YongKang Liu +4LLM Fine-TuningLLM Safety

  23. Sketching the Readout of Large Language Models for Scalable Data Attribution and Valuation

    Apr 17, 2026Yide Ran, Jianwen Xie, Minghui Wang +4Gradient-Based AttributionTraining Data Selection

  24. Motion Attribution for Video Generation

    Jan 13, 2026Xindi Wu, Despoina Paschalidou, Jun Gao +5Gradient-Based AttributionFeature Attribution

  25. Are AI Coders Snitches? An Empirical Study of Pretraining Data Detection on Code Large Language Models

    Jul 23, 2025Tianlin Li, Yunxiang Wei, Zhiming Li +5LLM EvaluationCode Language Models

  26. Neural Dynamic Data Valuation via Stochastic State-Adjoint Trajectories

    Apr 30, 2024Zhangyong Liang, Ji Zhang, Huanhuan GaoCooperative Game TheoryGame Theory