Training Data Selection

Latest papers 128

All topics
CardsList
  1. Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning

    Mar 12, 2026Rujie Wu, Haozhe Zhao, Hai Ci +1Video UnderstandingInstruction-Tuning Data Selection

  2. QAQ: Bidirectional Semantic Coherence for Selecting High-Quality Synthetic Code Instructions

    Mar 12, 2026Jiayin Lei, Ming Ma, Yunxi Duan +2Instruction-Tuning Data SelectionCode Generation

  3. VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning

    Mar 1, 2026Mingkang Dong, Hongyi Cai, Jie Li +4Vision-Language ModelsData Selection

  4. Explainable Token-level Noise Filtering for LLM Fine-tuning Datasets

    Feb 16, 2026Yuchen Yang, Wenze Lin, Enhao Huang +6LLM Fine-TuningTraining Data Curation

  5. Not All Preferences Deserve Gradients: Understanding Gradient Utility in Offline Reasoning Alignment

    Feb 1, 2026Hui Wu, Hengyi Cai, Jinman Zhao +6Pairwise Preference LearningTraining Data Selection

  6. Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining

    Oct 1, 2025Thiziri Nait Saada, Louis Bethune, Michal Klein +3Language Model PretrainingTraining Data Curation

  7. Predicting LLM Reasoning Performance with Small Proxy Model

    Sep 25, 2025Woosung Koh, Juyoung Suk, Sungjun Han +2Language Model PretrainingLLM Evaluation

  8. Learning by Surprise: Adaptive Mitigation of Model Collapse in Large Language Models

    Oct 16, 2024Daniele Gambetta, Gizem Gezici, Fosca Giannotti +3Model CollapseTraining Data Selection