Training Data Selection

Latest papers 128

All topics
CardsList
  1. Beyond What to Select: A Plug-and-play Oscillatory Data-Volume Scheduling for Efficient Model Training

    May 14, 2026Suorong Yang, Hanqi Zhu, Hai Gan +4Deep Learning OptimizationData Selection

  2. What properties of reasoning supervision are associated with improved downstream model quality?

    May 13, 2026Mikołaj Langner, Dzmitry Pihulski, Jan Eliasz +5Training Data SelectionLLM Reasoning

  3. GRACE: Gradient-aligned Reasoning Data Curation for Efficient Post-training

    May 13, 2026Junjie Li, Ziao Wang, NingXuan Ma +2Training Data SelectionLLM Post-Training

  4. SLAP: Stratified Loss-based Pruning for On-Policy Data-Efficient Instruction Tuning

    May 13, 2026Run Zou, Jianhang Ding, Yifan Ding +3LLM Fine-TuningInstruction-Tuning Data Selection

  5. From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning

    May 13, 2026Haodong Wu, Jiahao Zhang, Lijie Hu +1Supervised Fine-TuningTraining Data Curation

  6. Data Difficulty and the Generalization--Extrapolation Tradeoff in LLM Fine-Tuning

    May 13, 2026Siyuan Liu, Tinghong Chen, Xinghan Li +2Supervised Fine-TuningTraining Data Selection

  7. How Faithful Is Trajectory-Based Data Attribution? Error Sources, Remedies, and Practical Guidelines

    May 12, 2026Junwei Deng, Pingbang Hu, Suliang Jin +4Gradient-Based AttributionData Selection

  8. Constraint-Data-Value-Maximization: Utilizing Data Attribution for Effective Data Pruning in Low-Data Environments

    May 11, 2026Danilo Brajovic, David A. Kreplin, Marco F. HuberDataset PruningTraining Data Selection

  9. LiBaGS: Lightweight Boundary Gap Synthesis for Targeted Synthetic Data Selection

    May 11, 2026Abhishek Moturu, Anna Goldenberg, Babak TaatiSynthetic Data AugmentationTraining Data Selection

  10. Is Data Shapley Not Better than Random in Data Selection? Ask NASH

    May 11, 2026Xiao Tian, Jue Fan, Rachael Hwee Ling Sim +3Data SelectionTraining Data Selection

  11. Let the Target Select for Itself: Data Selection via Target-Aligned Paths

    May 10, 2026Huitao Yang, Hengzhi He, Tung Sum Thomas Kwok +1Data SelectionTraining Data Selection

  12. Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training

    May 8, 2026Pingbang Hu, Xueshen Liu, Z. Morley Mao +1Supervised Fine-TuningTraining Data Selection

  13. Building informative materials datasets beyond targeted objectives

    May 6, 2026Rafael Espinosa Castañeda, Ashley Dale, Hongchen Wang +6Data SelectionMaterials Property Prediction

  14. Leveraging Data Symmetries to Select an Optimal Subset of Training Data under Label Noise

    May 3, 2026Kumar Shubham, Pavan Karjol, Kiran M K +1Training Data SelectionLearning with Noisy Labels

  15. SCARV: Structure-Constrained Aggregation for Stable Sample Ranking in Redundant NLP Datasets

    May 1, 2026Xu Zheng, Feiyu Wu, Linhong Wu +2Training Data SelectionML Reproducibility

  16. EvoSelect: Data-Efficient LLM Evolution for Targeted Task Adaptation

    Apr 28, 2026Ting-Wei Li, Sirui Chen, Jiaru Zou +4LLM Fine-TuningSynthetic Data Generation

  17. Sample Selection Using Multi-Task Autoencoders in Federated Learning with Non-IID Data

    Apr 28, 2026Emre Ardıç, Yakup GençNon-IID Federated LearningTraining Data Selection

  18. Nearly Optimal Subdata Selection

    Apr 27, 2026Min Yang, Wei Zheng, John Stufken +3Data SelectionTraining Data Selection

  19. CRAFT: Clustered Regression for Adaptive Filtering of Training data

    Apr 24, 2026Parthasarathi Panda, Asheswari Swain, Subhrakanta PandaData SelectionTraining Data Selection

  20. Cross-Domain Data Selection and Augmentation for Automatic Compliance Detection

    Apr 23, 2026Fariz Ikhwantri, Dusica MarijanDomain AdaptationTraining Data Selection

  21. RADS: Reinforcement Learning-Based Sample Selection Improves Transfer Learning in Low-resource and Imbalanced Clinical Settings

    Apr 22, 2026Wei Han, David Martinez, Anna Khanina +2Class-Imbalanced LearningFew-Shot Learning

  22. Rethinking Dataset Distillation: Hard Truths about Soft Labels

    Apr 20, 2026Priyam Dey, Aditya Sahdev, Sunny Bhati +2Training Data SelectionDataset Distillation

  23. Continual Safety Alignment via Gradient-Based Sample Selection

    Apr 19, 2026Thong Bach, Dung Nguyen, Thao Minh Le +1Continual Learning for LLMsLLM Fine-Tuning

  24. Sketching the Readout of Large Language Models for Scalable Data Attribution and Valuation

    Apr 17, 2026Yide Ran, Jianwen Xie, Minghui Wang +4Gradient-Based AttributionTraining Data Selection

  25. Target-Oriented Pretraining Data Selection via Neuron-Activated Graph

    Apr 17, 2026Zijun Wang, Haoqin Tu, Weidong Zhou +7Language Model PretrainingTraining Data Selection

  26. Not All Forgetting Is Equal: Retention Dynamics in Fine-Tuned Image Classifiers

    Apr 13, 2026Miit Daga, Swarna Priya RamuFine-TuningData Selection

  27. DataFlex: A Unified Framework for Data-Centric Dynamic Training of Large Language Models

    Mar 27, 2026Hao Liang, Zhengyang Zhao, Mingrui Chen +22Training Data SelectionData Mixture Optimization