cs.SDOct 8, 2026

Cross-Lingual Speaker Verification with Self-Supervised Pre-Trained Models

Authors: Jinghan Peng, Yu Zheng, Weiqiang Wang, Jian Liu

Organizations: Machine Intelligence, Ant Group, Shanghai, China

Abstract

Speaker verification (SV) performance degrades under language mismatch due to the entanglement of speaker identity with language-specific acoustic cues. To address this problem, we leverage large-scale self-supervised pre-trained models (PTMs) to learn language-agnostic speaker representations. We utilize PTMs as robust front-end feature extractors, capitalizing on their rich acoustic and linguistic knowledge acquired from vast, diverse audio data. These generalized features are then used to train a downstream speaker embedding network, effectively disentangling speaker identity from language-specific characteristics. We validate our approach on the TidyVoice2026 benchmark, which benchmarks SV under language mismatch. Our proposed system (team T02) achieves equal error rates (EERs) of 2.21% on tv26_eval-A and 2.99% on tv26_eval-U.

Figures & tables

Explore similar work

CardsList
  1. Simple Language Normalization Wins: Cross-Lingual Speaker Verification for the TidyVoice 2026 Challenge

    Jul 24, 2026Nina Hosseini-KivananiSpeaker Verification

  2. L-Proto: Language-Aware Episodic Prototypical Training for Multilingual Speaker Verification

    Jun 16, 2026Hyung-Seok Oh, Deok-Hyeon Cho, Seung-Bin Kim +1Speaker Verification

  3. Disentangling Speaker and Language Effects in Cross-Lingual Speaker Verification for Iberian Languages

    Jul 1, 2026Pol Buitrago, Javier HernandoSpeaker VerificationCross-Lingual Transfer