Language Identification

Latest papers 14

All topics
CardsList
  1. Mitigating Accent-Language Confusion in Self-Supervised Speech Representations for Language Identification

    Oct 7, 2026Minu Kim, Jihwan Lee, David R. Mortensen +1Language IdentificationAlgorithmic Bias

  2. Code-Switching Spoken Language Identification as Multi-Label Set Prediction

    Oct 1, 2026Shunsuke Mitsumori, Matthew Wiesner, Shigeo Morishima +1Multi-Label ClassificationLanguage Identification

  3. IndicTriMix: Developing Language Identification Datasets and Models for Tri-Language Code-Mixing

    Sep 11, 2026Pruthwik Mishra, Rudra Trivedi, Avi Patel +2Language Identification

  4. Vocal Music under Phoneme-Conditional Analysis

    Aug 31, 2026Hayoon Kim, Kyogu LeeLanguage Identification

  5. Language Identification with Succinct Machine-Independent Traces

    Jul 14, 2026Moses Charikar, Jon Kleinberg, Chirag PabbarajuLanguage Identification

  6. Improving low-resource ASR using bilingual fine-tuning with language identification: a cross-linguistic evaluation

    Jun 16, 2026Reihaneh Amooie, Yun Hao, Wietse de Vries +3Fine-TuningLanguage Identification

  7. CHALIS: A Challenge Dataset for Language Identification in Difficult Scenarios

    Jun 4, 2026Michal Tichý, Jindřich LibovickýDistribution Shift RobustnessLanguage Identification

  8. Spoken Language Identification with Pre-trained Models and Margin Loss

    May 3, 2026Zhihua Fang, Liang He, Weiwu JiangLanguage IdentificationSpeech Processing

  9. Safe Language Generation in the Limit

    Jan 13, 2026Antonios Anastasopoulos, Giuseppe Ateniese, Evgenios M. KornaropoulosLanguage IdentificationText Generation

  10. Sparse Autoencoders Can Capture Language-Specific Concepts Across Diverse Languages

    Jul 15, 2025Lyzander Marciano Andrylie, Inaya Rahmanisa, Mahardika Krisna Ihsani +3Multilingual Language ModelsRepresentation Learning

  11. What Language is This? Ask Your Tokenizer

    Date pendingClara Meister, Ahmetcan Yavuz, Pietro Lesci +1Language IdentificationText Classification

  12. Fine PT-PT Web: A High-Quality 41 Billion Tokens Data Collection of the European Portuguese Web

    Date pendingGonçalo Vinagre, Rui Pedro Guerra, Pedro Gomes +7Language Model PretrainingLanguage Identification