Indian Languages

Momentum

8 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 6Week of Sep 21

Latest papers 40

All topics
CardsList
  1. Word Similarity Datasets for Indian Languages: Annotation and Baseline Systems

    Sep 28, 2026Syed S. Akhtar, Arihant Gupta, Avijit Vajpayee +2Indian LanguagesHindi

  2. BaatCheet: A Multilingual Corpus for Dialogue Translation in Indian Languages

    Sep 27, 2026Priyanka Dasari, Yuvrajsinh D. Bodana, Vandan Mujadia +3Translation QualityMultilingual Benchmark

  3. Benchmarking and Domain Adaptation of Automatic Speech Recognition (ASR) for Adolescent Health Communication in Ghanaian Languages

    Sep 24, 2026Stephen E. Moore, Akwasi Asare, Mich-Seth Owusu +3Automatic Speech RecognitionDomain Adaptation

  4. COILD: An Indic-Centric Parallel Corpus and Benchmark for Machine Translation Across Indian Languages

    Sep 23, 2026Kshetrimayum Boynao Singh, Nitin Kumar Mishra, Palash Pratim Dutta +22Indian LanguagesMachine Translation

  5. Vimarsha: Faithful ASR Evaluation for Indian Languages with Demographic Diversity, In-the-Wild Audio and Spelling Variations

    Sep 21, 2026Kaushal Santosh Bhogale, Srija Anand, Sadakopa Ramakrishnan Thothathiri +3Automatic Speech Recognition EvaluationIndian Languages

  6. Dynamics of Meaning: Towards the Evaluation of Diachronic Semantic Change in Sinhala

    Sep 8, 2026Nevidu Jayatilleke, Nisansa de SilvaLow-Resource LanguagesIndian Languages

  7. IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks

    Sep 3, 2026Saikat Mondal, Mamta, Deeksha Varshney +2Large Language Model SafetyLarge Language Model Evaluation

  8. VakyArth: Evaluating Pragmatic Competence in LLMs across Indic Languages

    Sep 1, 2026Usneek Singh, Poorvaja Veera Balaji Kumar, Parth Nanda +4Indian LanguagesNatural Language Inference

  9. Padamitra: Grounded Glossary Generation for Classical Sanskrit

    Aug 25, 2026Manoj Balaji Jagadeeshan, Sai Pragnaan Marala, Pawan GoyalBodhiIndian Languages

  10. Evaluation of forced alignment of code-mixed speech: the case of Hindi-English

    Jul 28, 2026Ayushi Pandey, Pamir Gogoi, Kevin TangGrapheme-To-PhonemeIndian Languages

  11. Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages

    Jul 26, 2026Deovrat Mehendale, Aditya Mehndiratta, Dhruv Rathi +2Speaker DiarizationMultilingual Automatic Speech Recognition

  12. BHARATI: Morphology-Aware Tokenizers for Classical Indian Languages with Subword Fertility Analysis

    Jul 25, 2026Poornima Kumaresan, Pavithra Muruganantham, Lakshmi Rajendran +1Subword TokenizationIndian Languages

  13. A Word-Level Digital Reader of the Prasthanatrayi with Sankara's Bhasya: Corpus, Method, and an Open, Offline Reading Aid for the Advaita Vedanta Canon

    Jul 8, 2026Tamal MaharajBodhiIndian Languages

  14. Rethinking Indic AI from a Lens of Cultural Heritage Preservation

    Jul 7, 2026Aparna Madva, Sharath Srivatsa, Srinath Srinivasa +1Indian LanguagesNatural Language Processing

  15. From Sinhala to Dhivehi: Cross-Lingual Transfer Learning for Low-Resource Speech Recognition

    Jul 7, 2026Lukmal Ilyas, Nevidu JayatillekeMultilingual Automatic Speech RecognitionCross-Lingual Transfer

  16. SalAngaBhava: A Sinhala Market Dataset for Aspect-based Sentiment Analysis

    Jul 6, 2026Lakshani Galwatta, Nisansa de Silva, Sarangi Aththanayake +1Natural Language DatasetsIndian Languages

  17. Jointly Improving Dialect Identification and ASR in Indian Languages using Multimodal Feature Fusion

    Jul 3, 2026Saurabh Kumar, Amartyaveer, Prasanta Kumar GhoshMultilingual Automatic Speech RecognitionAutomatic Speech Recognition

  18. SamaVaani: Auditing and Debiasing Multilingual Clinical ASR for Indian Languages

    Jun 25, 2026Subham Kumar, Prakrithi Shivaprakash, Abhishek Manoharan +7Multilingual Automatic Speech RecognitionAutomatic Speech Recognition

  19. A Pāninian Foundation for Indic Language Processing

    Jun 23, 2026Ritwik Banerjee, Lav R. VarshneyIndian LanguagesLanguage Pairs

  20. Deep Learning-Based Sign Language Recognition from Videos and Cross-Lingual Translation to Indian Vernaculars

    Jun 21, 2026Ramesh Nandipalli, Chandranath AdakSign Language TranslationIndian Languages

  21. AgriGov: A Structured Multilingual Dataset Curation for Indian Government Schemes for Farmers

    Jun 6, 2026Mohsina Bilal, Gopakumar GNatural Language DatasetsIndian Languages

  22. English-to-Prakrit Machine Translation via Multilingual Transfer Learning

    Jun 4, 2026Om Choksi, Smit Kareliya, Shrikant Malviya +1Indian LanguagesText Corpora

  23. Evaluating Cross-lingual Knowledge Consistency in Code-Mixed vis-a-vis Indian Languages using IndicKLAR

    May 28, 2026Debajyoti Mazumder, Divyansh Pathak, Prashant Kodali +3Cross-Lingual ConsistencyIndian Languages

  24. IndicMedDialog: A Parallel Multi-Turn Medical Dialogue Dataset for Accessible Healthcare in Indic Languages

    May 13, 2026Shubham Kumar Nigam, Suparnojit Sarkar, Piyush PatelMultilingual Healthcare Q&AConversational Datasets

  25. Nsanku: Evaluating Zero-Shot Translation Performance of LLMs for Ghanaian Languages

    May 5, 2026Stephen E. Moore, Mich-Seth Owusu, Akwasi Asare +13African LanguagesCross-Lingual Consistency

  26. SiNFluD: Creating and Evaluating Figurative Language Dataset for Sindhi

    May 2, 2026Wazir Ali, Adeeb Noor, Saifullah TumraniNatural Language DatasetsMetaphors

  27. Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation

    Apr 29, 2026Akhil Rajeev P, Annarao KulkarniNamed-Entity RecognitionIndian Languages

  28. Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages

    Apr 23, 2026Srija Anand, Ashwin Sankar, Ishvinder Sethi +10Seed-Tts-Eval BenchmarkMultilingual Automatic Speech Recognition

  29. BhashaSutra: A Task-Centric Unified Survey of Indian NLP Datasets, Corpora, and Resources

    Apr 20, 2026Raghvendra Kumar, Devankar Raj, Sriparna SahaIndian LanguagesNatural Language Datasets

  30. SiDiaC-v.2.0: Sinhala Diachronic Corpus Version 2.0

    Mar 11, 2026Nevidu Jayatilleke, Nisansa de Silva, Uthpala Nimanthi +3Indian LanguagesText Corpora

  31. SinLlama -- A Large Language Model for Sinhala

    Aug 12, 2025H. W. K. Aravinda, Rashad Sirajudeen, Samith Karunathilake +3Indian LanguagesLow-Resource Languages