Data Contamination in Language Models

Latest papers 39

All topics
CardsList
  1. LLM Benchmark Datasets Should Be Contamination-Resistant

    May 19, 2026Ali Al-Lawati, Jason Lucas, Dongwon Lee +1LLM EvaluationBenchmark Contamination

  2. Reasoners or Translators? Contamination-aware Evaluation and Neuro-Symbolic Robustness in Tax Law

    May 15, 2026Parisa Kordjamshidi, Samer Aslan, Madhavan Seshadri +2Data Contamination in Language ModelsNeuro-Symbolic Reasoning

  3. PermaFrost-Attack: Stealth Pretraining Seeding(SPS) for planting Logic Landmines During LLM Training

    Apr 23, 2026Harsh Kumar, Rahul Maity, Tanmay Joshi +4Language Model PretrainingLLM Backdoor Attacks

  4. Language Generation with Replay: A Learning-Theoretic View of Model Collapse

    Mar 12, 2026Giorgio Racca, Michal Valko, Amartya SanyalModel CollapseData Contamination in Language Models

  5. Can Generative Artificial Intelligence Survive Data Contamination? Theoretical Guarantees under Contaminated Recursive Training

    Feb 17, 2026Kevin Wang, Hongqian Niu, Didong LiModel CollapseGenerative Modeling

  6. Quantifying the Effect of Test Set Contamination on Generative Evaluations

    Jan 7, 2026Rylan Schaeffer, Joshua Kazdan, Baber Abbasi +8Language Model Generation EvaluationBenchmark Contamination

  7. Is Your Benchmark Still Useful? Dynamic Benchmarking for Code Language Models

    Mar 9, 2025Batu Guan, Xiao Wu, Yuanyuan Yuan +1Benchmark DesignData Contamination in Language Models