cs.CLOct 8, 2026

Adapting English Quality Classifiers for Multilingual LLM Pretraining Data Selection

Authors: Vinko Sabolčec, Bettina Messmer, Yassine Turki, Martin Jaggi

Organizations: EPFL

Abstract

Recent advances in large language model (LLM) pretraining highlight the role of high-quality training data in improving performance. While model-based filtering has proven effective in selecting high-quality subsets from web-scale corpora, especially for high-resource languages, low-resource languages face challenges due to limited availability of annotated data. This work explores extending quality filtering to over 100 languages by proposing a multilingual adaptation approach that converts an existing English quality classifier into a multilingual variant. Our approach proposes training a small multi-layer perceptron on top of Transformer encoder-only model embeddings, using multilingual text as input and scores obtained from English classifiers applied to machine-translated text as labels. Our 1B, 3B and 8B scale experiments show that our approach maintains the downstream LLM benchmark performance of existing multilingual model-based filtering baselines, without harming regional and cultural knowledge benchmarks. To further evaluate cross-lingual generalization, we compare classifier scores of high-quality synthetic data and web samples, and the correlation of classifier scores with LLM-based ones, revealing that the classifier can learn the scoring criteria of its original English variant, even for languages not included in its training data.

Figures & tables

Appendix figures & tables3 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. Toward Cross-Lingual Quality Classifiers for Multilingual Pretraining Data Selection

    Apr 22, 2026Yassine Turki, Vinko Sabolčec, Bettina Messmer +1Language Model PretrainingMultilingual Language Models

  2. Predicting Multilingual Classification and Translation Performance of LLMs with Cross-Lingual Alignment \unicodex2013\unicode{x2013} Is English Enough?

    Aug 4, 2026Adnan Al Ali, Kathy Hämmerl, Jindřich Libovický +1Multilingual Language Model EvaluationCross-Lingual Representation Alignment