Training Data Selection

Latest papers 128

All topics
CardsList
  1. GRASP: Geometry-aware Residual Alignment for Scalable Pretraining Data Attribution

    Jun 5, 2026Yue Min, Ruining Chen, Yujun LiData SelectionTraining Data Selection

  2. Can Generalist Agents Automate Data Curation?

    Jun 2, 2026Feiyang Kang, Hanze Li, Adam Nguyen +5AI Coding AgentsTraining Data Curation

  3. Mitigating Spurious Correlations with Memorization-Guided Dataset De-Biasing

    Jun 1, 2026Arda Fazla, Abolfazl HashemiDebiased MLTraining Data Selection

  4. Trust Functions: Near-Lossless Weak-to-Strong Generalization by Learning When to Trust the Weak Teacher

    May 31, 2026Arda Uzunoglu, Alvin Zhang, Daniel KhashabiData SelectionTraining Data Selection

  5. On the Difficulty of Learning a Meta-network for Training Data Selection

    May 30, 2026Zilin Du, Junqi Zhao, Boyang Albert LiMeta-LearningTraining Data Selection

  6. Escaping the Mode Lottery: Multi-Response Training Improves Language Model Generalization

    May 30, 2026Hasan Amin, Kian Ahrabian, Ming Yin +1LLM Fine-TuningOOD Generalization

  7. Towards Efficient LLMs Annealing with Principled Sample Selection

    May 29, 2026Yuanjian Xu, Jianing Hao, Wanbo Zhang +2Language Model PretrainingEfficient Language Model Training

  8. Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning

    May 29, 2026Yuhuan Yuan, Zhouliang Yu, Minghao Liu +2Physical ReasoningVisual Spatial Reasoning

  9. MADS: Model-Aware Diverse Core Set Selection for Instruction Tuning

    May 29, 2026Yi Bai, Wenhao Zhang, Yao Chen +3Instruction-Tuning Data SelectionTraining Data Selection

  10. The Long-Term Effects of Data Selection in LLM Fine-Tuning

    May 28, 2026Yuxin Yang, Aoxiong Zeng, Xiangquan YangContinual Learning for LLMsLLM Fine-Tuning

  11. MIRA: Mid-training Rubric Anchoring for Source-Aware Data Selection

    May 28, 2026Haowen Wang, Yaxin Du, Jian Yang +9Data SelectionEfficient Language Model Training

  12. Tailoring the Curriculum: Student-Centered Reasoning Distillation via Dynamic Data-Model Compatibility

    May 28, 2026Jiahao Huang, Fei Cheng, Junfeng Jiang +1Reasoning DistillationTraining Data Selection

  13. Single-Rollout Hidden-State Dynamics for Training-Free RLVR Data Selection

    May 27, 2026Jianghao Wu, Jianfei Cai, Weiqiang Wang +3Training Data SelectionReinforcement Learning with Verifiable Rewards

  14. GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection

    May 27, 2026Zheng Wu, Chengcheng Han, Zhengxi Lu +5GUI AgentsTraining Data Selection

  15. Refining Multidimensional Video Reward Models via Disentangled Influence Functions

    May 27, 2026Muyao Wang, Zeke Xie, Hideki NakayamaReward ModelingTraining Data Selection

  16. SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection

    May 27, 2026Shuhao Chen, Weisen Jiang, Yeqi Gong +5LLM Fine-TuningLLM Safety Alignment

  17. Memory-Distilled Selection for Noise-Robust Anomaly Detection

    May 26, 2026Sirojbek Safarov, Jaewoo Park, Yoon Gyo Jung +4Industrial Anomaly DetectionData Selection

  18. Complement Submodular Information Measures for Balanced and Robust Data Selection

    May 23, 2026Rishabh IyerSubmodular OptimizationData Selection

  19. Unified Data Selection for LLM Reasoning

    May 21, 2026Xiaoyuan Li, Yubo Ma, Chengpeng Li +6Training Data SelectionLLM Training

  20. TimeGuard: Channel-wise Pool Training for Backdoor Defense in Time Series Forecasting

    May 21, 2026Quang Duc Nguyen, Siyuan Liang, Yiming Li +2Backdoor AttacksTime Series Forecasting

  21. PRISM: Preference-Aware Influence Function Based Data Selection Method for Efficient Fine-Tuning

    May 20, 2026Qihao Lin, Guanxu Chen, Dongrui Liu +1Supervised Fine-TuningLLM Fine-Tuning

  22. From Parameters to Data: A Task-Parameter-Guided Fine-Tuning Pipeline for Efficient LLM Alignment

    May 20, 2026Hao Chen, Qi Zhang, Liyao Li +7LLM AlignmentLLM Fine-Tuning

  23. Weasel: Out-of-Domain Generalization for Web Agents via Importance-Diversity Data Selection

    May 19, 2026Fatemeh Pesaran Zadeh, Seyeon Choi, Xing Han Lù +2OOD GeneralizationTraining Data Selection

  24. A Bitter Lesson for Data Filtering

    May 19, 2026Christopher Mohri, John Duchi, Tatsunori HashimotoLanguage Model PretrainingTraining Data Curation

  25. SAS: Semantic-aware Sampling for Generative Dataset Distillation

    May 18, 2026Mingzhuo Li, Guang Li, Linfeng Ye +4Training Data SelectionDataset Distillation

  26. SEED: Targeted Data Selection by Weighted Independent Set

    May 15, 2026Yuan Zhang, Lifeng Guo, Junwen Pan +5Training Data CurationInstruction-Tuning Data Selection