Dialects

Momentum

7 papers in the last four weeks, up 133% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 41

All topics
CardsList
  1. BanglaDial-Abuse: A Corpus-Grounded Dataset for Regional Dialect Identification in Abusive Bangla Text

    Oct 1, 2026Hasin Almas SifatBanglaDialects

  2. CARDAMOM: A Micro-Dialectal Arabic Speech Dataset for ASR

    Sep 28, 2026Bashar Talafha, Samar M. Magdy, Aisha Alansari +36DialectsMultilingual Automatic Speech Recognition

  3. Some Dialects Are More Equal Than Others: Non-Prestigious Arabic Dialectal Bias in LLMs

    Sep 21, 2026Mai Mohamed Eida, Ryan Dolan, Paul de Nijs +1DialectsArabic

  4. From a River in Gilead to the Inference Distributions of Large Language Models: Covert Dialect Bias and Linguistic Profiling at Scale

    Sep 16, 2026Chowdhury Mohammad Abdullah, Rita OrjiLarge Language Model BiasDialects

  5. 5-Dialects-BN: Unmasking the Impact of Transliteration on Bangla Dialectal LLMs

    Sep 9, 2026Md Mahir Jawad, Galib Mahmud Jim, Rafid Ahmed +3DialectsBangla

  6. BavGround: A Benchmark for Regional Cultural Grounding and Dialect Competence in Bavarian

    Aug 13, 2026Jophin John, Michael Hoffmann, Jan Fillies +2Multilingual BenchmarkDialects

  7. Unified Multi-Dialectal Neural Machine Translation for Bangla Using the Dwadash Benchmark Corpus

    Aug 12, 2026Rakib Ullah, Md. Ruhul Islam, Tanbir Ahmed +1DialectsNeural Machine Translation

  8. How Robust Are LLMs to Vietnamese Dialects?

    Aug 11, 2026Minh Tran, Trinh Chau, Thanh-Nhan Le +4DialectsNatural Language Inference

  9. DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects

    Aug 8, 2026Yi Shu, Tianyu Peng, Yingzhuo Deng +5DialectsSelf-Supervised Speech Models

  10. Different Perturbations, Different Mechanisms: Understanding Continued Pre-training for Zero-Shot Dialect Robustness

    Aug 6, 2026Aarohi Srivastava, David ChiangDialectsMultilingual Language Models

  11. Romanized Arabic Across Dialects: Views, Usage Patterns, and Linguistic Variation

    Aug 3, 2026Amr Keleg, Ahmed Amine Ben Abdallah, Taha Yassine +3ArabicDialects

  12. ArabicDialectSafety: A Dialect-Aware Benchmark for Arabic Content Safety Classification

    Aug 2, 2026Wajdi Zaghouani, Md. Rafiul Biswas, Kholoud Khalil Aldous +1Arabic Natural Language ProcessingArabic

  13. The Morphological Core of Dungan: A Two-Dialect Finite-State Model and a Multi-Genre Evaluation

    Jul 30, 2026Anton M. Alekseev, Sergey I. NikolenkoMorphologyGrammaticality

  14. Learning the Arabic Dialect Continuum as a Continuous Space: A Regression Approach to Speaker Origin Prediction

    Jul 22, 2026Mohamed Aziz Khadraoui, Adel Ammar, Bilel Benjdira +3DialectsArabic

  15. Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results

    Jul 21, 2026Ilse Huisman, Rares Popa, Yuanyuan Zhang +1Automatic Speech Recognition EvaluationAutomatic Speech Recognition

  16. DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation

    Jul 8, 2026Jordan Painter, Dipankar Srirag, Adarsh Kappiyath +3DialectsLarge Language Model Adaptation

  17. LLMs Silently Correct African American English: Auditing and Mitigating Dialect Bias via Activation Steering

    Jul 7, 2026Huan Wu, Ali Emami, Muhammad Furquan Hassan +5Large Language Model BiasDialects

  18. Can Dialects Be Steered Like Languages? Sparse Neurons and Distributed Directions in Arabic LLMs

    Jul 4, 2026Kareem Elozeiri, Mervat Abassy, Omar Kallas +4Arabic Natural Language ProcessingDialects

  19. Jointly Improving Dialect Identification and ASR in Indian Languages using Multimodal Feature Fusion

    Jul 3, 2026Saurabh Kumar, Amartyaveer, Prasanta Kumar GhoshMultilingual Automatic Speech RecognitionAutomatic Speech Recognition

  20. Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models

    Jun 24, 2026Tomoya Mizumoto, Yusuke Fujita, Hao Shi +3DialectsSpeech Language Models

  21. Speech-Driven End-to-End Language Discrimination towards Chinese Dialects

    Jun 17, 2026Fan Xu, Jian Luo, MingWen Wang +1DialectsText Corpora

  22. P3B3: A Multi-Turn Conversational Benchmark for Measuring European and Brazilian Portuguese Variety Bias in LLMs

    Jun 15, 2026Rafael Ferreira, Inês Vieira, Inês Calvo +6Multilingual BenchmarkPortuguese

  23. An End-to-End Hybrid Framework for Rumour Detection in Low-Resources Algerian Dialect

    Jun 11, 2026Dihia Lanasri, Fatima BenbarekArabicDialects

  24. Towards Robust Arabic Speech Emotion Recognition with Deep Learning

    Jun 9, 2026Youcef Soufiane Gheffari, Samiya SilarbiArabic Natural Language ProcessingEmotion Recognition

  25. UniQL: Towards Dialect-Universal Benchmarking for Text-to-SQL

    Jun 6, 2026Jianling Gao, Chongyang Tao, Jiayuan Bai +7Text-To-SqlDialects

  26. PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects

    May 31, 2026Sicheng Yang, Shulan Ruan, Shiwei Wu +4Multilingual Automatic Speech RecognitionDialects

  27. Phonetic Modeling of Dialectal Variation in Vietnamese Speech

    May 23, 2026Quan Ngoc Hoang, Long Hoang Huu Nguyen, Nghia Hieu Nguyen +2Grapheme-To-PhonemeDialects

  28. Side-by-side Comparison Amplifies Dialect Bias in Language Models

    May 23, 2026Kritee Kondapally, Claire J. Smerdon, Pooja C. Patel +5Large Language Model BiasDialects

  29. Linear Semantic Segmentation for Low-Resource Spoken Dialects

    May 7, 2026Kirill Chirkunov, Younes Samih, Abed Alhakim Freihat +1DialectsArabic

  30. Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues

    Apr 30, 2026Muhammad Dehan Al Kautsar, Saeed Almheiri, Momina Ahsan +13Arabic Natural Language ProcessingArabic

  31. Resource-Lean Lexicon Induction for German Dialects

    Apr 26, 2026Robert Litschko, Barbara Plank, Diego FrassinelliDialectsGerman

  32. DIA-HARM: Dialectal Disparities in Harmful Content Detection Across 50 English Dialects

    Apr 7, 2026Jason Lucas, Matt Murtagh, Ali Al-Lawati +3DialectsMultilingual Benchmark

  33. Benchmarking Bengali Dialectal Bias: A Multi-Stage Framework Integrating RAG-Based Translation and Human-Augmented RLAIF

    Mar 22, 2026K. M. Jubair Sami, Dipto Sumit, Ariyan Hossain +1DialectsLarge Language Model Bias

  34. SalamahBench: Dialect and Category Level Safety Evaluation of Arabic Language Models

    Feb 3, 2026Omar Abdelnasser, Fatemah Alharbi, Khaled Khasawneh +2Arabic Natural Language ProcessingArabic

  35. Fine PT-PT Web: A High-Quality 41 Billion Tokens Data Collection of the European Portuguese Web

    Date pendingGonçalo Vinagre, Rui Pedro Guerra, Pedro Gomes +7Text CorporaPortuguese