Low-Resource Language Processing

Latest papers 342

All topics
CardsList
  1. A Pāninian Foundation for Indic Language Processing

    Jun 23, 2026Ritwik Banerjee, Lav R. VarshneyMultilingual Language Model EvaluationLow-Resource Language Processing

  2. A Fusion-Aware Two-Stage Framework for Mispronunciation Detection and Diagnosis in Low-Resource Modern Standard Arabic

    Jun 23, 2026Jing Yang, Shuqing Zhang, Yongyi Deng +5Domain AdaptationSpeech Processing

  3. VieSpeaker: A Large-Scale Vietnamese Speaker Recognition Dataset Beyond Visual Dependency

    Jun 23, 2026Viet Hoang Pham, Tran Trung Nguyen, Bao Thu Ho +2Speech ProcessingLow-Resource Language Processing

  4. ROMEVA: Geometry-Preserving Vocabulary Expansion for Roman Urdu Language Models

    Jun 21, 2026Mahnoor Khan, Afsheen Asif, Milhan Afzal Khan +2Multilingual Language ModelsWord Embeddings

  5. Neural Speaker Diarization via Multilingual Training: Evaluation on Low-Resource Nepali-Hindi Speech

    Jun 21, 2026Samip Neupane, Sandesh Pokhrel, Sandesh Pyakurel +1Low-Resource Language ProcessingSpeaker Diarization

  6. From Speech to Text Corpora: Evaluating ASR-Based Data Acquisition for Low-Resource Fongbe and Hausa

    Jun 20, 2026Mahounan Pericles Adjovi, Victor Olufemi, Roald Eiselen +1Automatic Speech RecognitionLow-Resource Language Processing

  7. The Language-Energy Divide: Measuring Energy Costs of Multilingual LLM Inference

    Jun 20, 2026Naihao Deng, Alissa Shen, Yiming Feng +5LLM Inference EfficiencyMultilingual Language Models

  8. OpenWER: Improving Cross-Lingual ASR Evaluation and Enabling Token-Based Accuracy Metrics

    Jun 19, 2026Korbinian Kuhn, Gottfried ZimmermannASR EvaluationLow-Resource Language Processing

  9. Phonemes to the Rescue: Multilingual Tokenization Based on International Phonetic Alphabet

    Jun 18, 2026Milan Miletić, Julie Kallini, Ekaterina ShutovaMultilingual Language ModelsLow-Resource Language Processing

  10. ReNikud: Audio-Supervised Hebrew Grapheme-to-Phoneme Conversion

    Jun 18, 2026Maxim Melichov, Yakov Kolani, Morris AlperTTS SynthesisLow-Resource Language Processing

  11. IHUBERT: Vector-Based Semantic Deduplication and Domain-Balanced Pretraining for Persian Resources

    Jun 18, 2026Arash Ghafouri, Mahdi Firouzmandi, Hossein Saberi +1Language Model PretrainingLanguage Modeling

  12. PorTEXTO: A European Portuguese Benchmark for Visual Text Extraction

    Jun 17, 2026João Cardeira, Diogo Glória-Silva, Manuel Letras da Luz +4Low-Resource Language ProcessingOptical Character Recognition

  13. Want Better Synthetic Data? Steer It: Activation Steering for Low-Resource Language Generation

    Jun 16, 2026Jan Cegin, Daniil Gurgurov, Yusser Al Ghussin +1Language Model SteeringSynthetic Data Generation for Language Models

  14. Examining the Limits of Word2Vec with Toki Pona

    Jun 15, 2026Daniel Zhenhan Huang, Hongchen WuText Embedding EvaluationDistributional Semantics

  15. A Text Recognition Dataset from Sahidic Coptic Ancient Manuscripts

    Jun 14, 2026Fabio Quattrini, Carmine Zaccagnino, Costanza Bianchi +2Online Handwriting RecognitionLow-Resource Language Processing

  16. Koshur Diacritizer: A Byte-Level Sequence-to-Sequence Model for Kashmiri Diacritic Restoration

    Jun 14, 2026Haq Nawaz Malik, Nahfid Nissar, Faizan IqbalLow-Resource Language Processing

  17. AmchiBias: Measuring Stereotypical Bias in Goan Identity Groups with a Minimal Pair Dataset in English and Konkani

    Jun 13, 2026Michelle Barbosa, Sebastian Padó, Franziska WeeberMultilingual Language Model EvaluationCultural Bias in Language Models

  18. PACUTE: Phonology-, Affix-, and Character-level Understanding of Tokens for Filipino

    Jun 13, 2026Jann Railey Montalan, David Demitri Africa, Jimson Paulo Layacan +3LLM EvaluationLanguage Modeling

  19. Equity with Efficiency: An Empirical Study of Tokenizers for Multilingual Large Language Models

    Jun 13, 2026Kieron Seven Jun Wei Lee, Muhammad Reza Qorib, Andrew Ivan Soegeng +1Multilingual Language ModelsSocial Bias in Language Models

  20. SkMTEB: Slovak Massive Text Embedding Benchmark and Model Adaptation

    Jun 11, 2026Marek Šuppa, Andrej Ridzik, Daniel Hládek +2Text EmbeddingsWord Embeddings

  21. AfriSUD: A Dependency Treebank Collection for Evaluating Models on African Languages

    Jun 10, 2026Happy Buzaaba, Cheikh Mouhamadou Bamba Dione, David Ifeoluwa Adelani +15Multilingual Language Model EvaluationMorphosyntactic Tagging

  22. Semantic Grading of Written Answers in Low-Resource Language Bangla Using a Fine-Tuned Lightweight Language Model

    Jun 10, 2026Meherun Farzana, Aniket Joarder, Mahmudul Hasan +1Educational AssessmentLow-Resource Language Processing

  23. Lius: Translation Model Based Instructional Lingustic Using Continual Instruction Tuning In Kupang Malay

    Jun 10, 2026Joanito Agili Lopo, Yunita Sari, Guntur Budi HerwantoLLM Fine-TuningLow-Resource MT