Data Mixture Optimization

Latest papers 23

All topics
CardsList
  1. Differentially Private Mixing of Public Datasets Improves Private Learning

    Oct 5, 2026Yufei Chen, Tejumade Afonja, Anvith Thudi +1Privacy-Preserving MLDifferential Privacy

  2. LLM Post-Training as Brownfield Maintenance: An Industrial Perspective on Dataware Engineering

    Aug 31, 2026Gopi Krishnan Rajbahadur, Amir M. Ebrahimi, Boyuan Chen +1Training Data CurationLLM Post-Training

  3. Token Distribution versus Data Volume: Domain Balancing in Multi-Domain Meeting Summarisation

    Aug 16, 2026Ashima Sood, Bryan Gardiner, Joan CondellLLM Fine-TuningText Summarization

  4. Harnessing the Potential of Optimizing Data Mixtures via Bayesian Domain Reweighting

    Jul 30, 2026Xiang Yuan, Kaiqing Lei, Zhenyu Jin +3Data Mixture OptimizationLLM Training

  5. DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes

    Jul 27, 2026Jiahao Xie, Zhongbin Guo, Qianle Wang +4Training Data CurationData Mixture Optimization

  6. Domain-Aware Scaling Laws Uncover Data Synergy

    Jul 13, 2026Kimia Hamidieh, Lester Mackey, David Alvarez-MelisLanguage Model PretrainingLanguage Model Scaling Laws

  7. HERMES: A Multi-Granularity Labeling Substrate for Pre-training Data Mixtures

    Jul 2, 2026Ziyun Qiao, Yue Min, Ruining Chen +1Language Model PretrainingTraining Data Curation

  8. CausalMix: Data Mixture as Causal Inference for Language Model Training

    Jul 1, 2026Zinan Tang, Yukun Zhang, Shaomian Zheng +6Data Mixture OptimizationLLM Training

  9. FastMix: Fast Data Mixture Optimization via Gradient Descent

    Jun 12, 2026Haoru Tan, Sitong Wu, Yanfeng Chen +5Language Model PretrainingData Mixture Optimization

  10. Explaining Data Mixing Scaling Laws

    Jun 6, 2026Rui Dai, Shuran ZhengData Mixture OptimizationNeural Scaling Laws

  11. TANDEM: Bi-Level Data Mixture Optimization with Twin Networks

    Jun 3, 2026Jiaxing Wang, Deping Xiang, Jin Xu +9Bilevel OptimizationData Mixture Optimization

  12. Scaling Laws for Mixture Pretraining Under Data Constraints

    May 12, 2026Anastasiia Sedova, Skyler Seto, Natalie Schluter +1Language Model PretrainingLanguage Model Scaling Laws

  13. GEM: Geometric Entropy Mixing for Optimal LLM Data Curation

    Apr 27, 2026Yue Min, Ziyun Qiao, Ruining Chen +1Language Model PretrainingTraining Data Curation

  14. DataFlex: A Unified Framework for Data-Centric Dynamic Training of Large Language Models

    Mar 27, 2026Hao Liang, Zhengyang Zhao, Mingrui Chen +22Training Data SelectionData Mixture Optimization

  15. Mixtures Closest to a Given Measure: A Semidefinite Programming Approach

    Sep 26, 2025Srećko Đurašinović, Jean-Bernard Lasserre, Victor MagronSemidefinite ProgrammingData Mixture Optimization

  16. DynamixSFT: Dynamic Mixture Optimization of Instruction Tuning Collections

    Aug 16, 2025Haebin Shin, Lei Ji, Xiao Liu +4Multi-Armed BanditsInstruction Tuning