Low-Resource Language Processing

Latest papers 342

All topics
CardsList
  1. Echoes Across Vietnam's Highlands, Delta, and Coast: A Multilingual Corpus for Cham, Khmer, and Tay-Nung

    Jul 9, 2026Anh Trac Duc Dinh, Khang Nhat Hoang Vo, Vinh Cong Doan +2Multilingual Language Model EvaluationMultilingual IR

  2. Rethinking Indic AI from a Lens of Cultural Heritage Preservation

    Jul 7, 2026Aparna Madva, Sharath Srivatsa, Srinath Srinivasa +1Multilingual Language ModelsCultural Bias in Language Models

  3. PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages

    Jul 7, 2026Daryna Dementieva, Nikolay Babakov, Kathy Hämmerl +14Mathematical Reasoning BenchmarksMultilingual Language Model Evaluation

  4. CoPiT: Cognitive Pivot Translation for Digraphic Low-Resource Mongolian in the Traditional Script

    Jul 7, 2026Burte Bayarsaikhan, Serynn Kim, Buru ChangLow-Resource MTLow-Resource Language Processing

  5. BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension

    Jul 6, 2026Abu Tyeb Azad, Ishita Sur Apan, Fahim Ahmed +8Document UnderstandingLLM Evaluation

  6. SalAngaBhava: A Sinhala Market Dataset for Aspect-based Sentiment Analysis

    Jul 6, 2026Lakshani Galwatta, Nisansa de Silva, Sarangi Aththanayake +1Aspect-Based Sentiment AnalysisLow-Resource Language Processing

  7. PAST-TIDE: Prototype-Anchored Statement Tuning with Topic-Invariant Normalization for Stance Detection

    Jul 6, 2026Md. Shakhoyat Rahman Shujon, MD Jahid Hasan Jim, Md. Milon Islam +2Stance DetectionArabic NLP

  8. Towards Digital Preservation of Efik: TTS for a Low-Resource African Language

    Jul 5, 2026Offiong Bassey Edet, Emmanuel Oyo-Ita, Archibong Okon Archibong +2TTS SynthesisSpeech Generation Evaluation

  9. BanglaMemeEvidence: A Multimodal Benchmark Dataset for Explanatory Evidence Detection in Bengali Memes

    Jul 4, 2026Fatema Tuj Johora Faria, Mukaffi Bin Moin, Md. Mahfuzur Rahman +3Low-Resource Language Processing

  10. LuxSQA: Ask Me in Luxembourgish with TTS-Augmented Spoken Question Answering

    Jul 2, 2026Nina Hosseini-Kivanani, Marco Matassoni, Alessio BruttiSpoken Language UnderstandingSynthetic Data Augmentation

  11. Challenges and Recommendations for LLM-as-a-Judge in Multilingual Settings and for Low-Resource Languages

    Jul 2, 2026A. Seza Doğruöz, Xixian Liao, Verena Blaschke +3Multilingual Language Model EvaluationLLM-as-a-Judge

  12. From Monolingual to Multilingual: Evaluating Mamba for ASR in South African Languages

    Jul 1, 2026Jesujoba O. Alabi, Julian Herreilers, Badr M. Abdullah +1ASR EvaluationLow-Resource Language Processing

  13. ALEE: Any-Language Evaluation of Embeddings via English-Centric Minimal Pairs

    Jun 30, 2026Andrianos Michail, Stylianos Psychias, Michelle Wastl +3Text Embedding EvaluationLow-Resource Language Processing

  14. LuxEmo: Expressive Text-to-Speech Corpus for Luxembourgish

    Jun 30, 2026Nina Hosseini-Kivanani, Sandipana DowerahSpeech ProcessingLow-Resource TTS Synthesis

  15. Cross-lingual Relation Extraction with Large Language Models: Zero-Shot, Few-Shot, and Fine-Tuned Evaluation on Romanian

    Jun 30, 2026Dragos-Mitrut Vasile, Elena-Simona Apostol, Stefan-Adrian Toma +2Relation ExtractionLLM Fine-Tuning

  16. Beyond Clean Text: Evaluating Encoder and Decoder Robustness for Bangla Event Detection in Noisy Text

    Jun 29, 2026Tanvir Ahmed Sijan, S. M Golam Rifat, Nayeemul Islam +1Decoder-Only Language ModelsLow-Resource Language Processing

  17. Cross-Temporal Sinhala OCR: Page-Level Adaptation and Diachronic Analysis

    Jun 28, 2026Avisha Dilhara, Nevidu JayatillekeLow-Resource Language ProcessingOptical Character Recognition

  18. SEATauBench: Adapting Tool-Agent-User Evaluation Into Low-Resource Southeast Asian Languages

    Jun 27, 2026My Chiffon Nguyen, Aulia Adila, Saksorn Ruangtanusak +4LLM Agent EvaluationAI Agent Evaluation

  19. Closing the Quality Gap in Low-Resource Text-to-Speech: LoRA Fine-Tuning of VoxCPM2 for Khmer and Korean

    Jun 25, 2026Phannet Pov, Hyun Woo Park, Voneat Pen +3Low-Resource TTS SynthesisLow-Resource Language Processing

  20. The Tatoxa System for Text Detoxification in Low-Resource Languages: The Case of Tatar

    Jun 24, 2026Ilseyar Alimova, Bogdan Monogov, Artyom Mazur +5Low-Resource Language Processing

  21. SARA: Unlocking Multilingual Knowledge in Mixture-of-Experts via Semantically Anchored Routing Alignment

    Jun 24, 2026Tianyu Dong, Yangyang Liu, Jiang Zhou +9Multilingual Language ModelsSparse Mixture-of-Experts

  22. Riazi-8B: An Urdu Large Language Model for Mathematical Reasoning

    Jun 24, 2026Azher Ali, Ibtsam Haider, Raja Khurram Shahzad +2Numerical Reasoning in Language ModelsLLM Fine-Tuning

  23. Neural Machine Translation for Low-Resource Tangkhul--English

    Jun 24, 2026Chormi Zimik Vashai, Agniva MaitiLow-Resource MTLow-Resource Language Processing

  24. L3Cube-MahaPOS: A Marathi Part-of-Speech Tagging Dataset and BERT Models

    Jun 23, 2026Hariom Ingle, Ronit Ghode, Ishwari Gondkar +2Morphosyntactic TaggingLow-Resource Language Processing

  25. Poster: Exploring the Limits of Audio-Based Detection of Turkish Phone Call Scams

    Jun 23, 2026Arda Eren, Micheal Cheung, Youqian Zhang +2Audio-Language Model EvaluationFinancial Fraud Detection

  26. Automatic Part-of-Speech Tagging of Arabic-English Dictionary Senses through WordNet

    Jun 23, 2026Diaa M. Fayed, Aly A. Fahmy, Mohsen A. Rashwan +1Arabic NLPMorphosyntactic Tagging