Automatic Speech Recognition

Also known as ASR

Momentum

54 papers in the last four weeks, up 238% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 302

All topics
CardsList
  1. WASIL: In-the-Wild Arabic Spoken Interactions with LLMs

    May 9, 2026Zien Sheikh Ali, Hamdy Mubarak, Soon-Gyo Jung +3Voice Agent EvaluationArabic NLP

  2. Dolphin-CN-Dialect: Where Chinese Dialects Matter

    May 9, 2026Yangyang Meng, Huihang Zhong, Guodong Lin +6Streaming ASRAutomatic Speech Recognition

  3. Beyond Single Ground Truth: Reference Monism as Epistemic Injustice in ASR Evaluation

    May 8, 2026Anna Seo Gyeong Choi, Maria Teleki, James Caverlee +3ASR EvaluationAutomatic Speech Recognition

  4. Bangla-WhisperDiar: Fine-Tuning Whisper and PyAnnote for Bangla Long-Form Speech Recognition and Speaker Diarization

    May 6, 2026Mohammed Aman Bhuiyan, Md Sazzad Hossain Adib, Samiul Basir Bhuiyan +4Audio UnderstandingAutomatic Speech Recognition

  5. A Comprehensive Analysis of Tokenization and Self-Supervised Learning in End-to-End Automatic Speech Recognition applied on French Language

    May 5, 2026Thibault Bañeras-Roux, Mickael Rouvier, Jane Wottawa +1ASR EvaluationAutomatic Speech Recognition

  6. A Paradigm for Interpreting Metrics and Identifying Critical Errors in Automatic Speech Recognition

    May 5, 2026Thibault Bañeras-Roux, Mickael Rouvier, Jane Wottawa +1ASR EvaluationAutomatic Speech Recognition

  7. Contrastive Regularization for Accent-Robust ASR

    May 5, 2026Van-Phat Thai, Aradhya Dhruv, Duc-Thinh Pham +1Automatic Speech RecognitionSupervised Contrastive Learning

  8. When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition

    May 4, 2026Pehuén Moure, Niclas Pokel, Bilal Bounajma +4Audio-Language Model EvaluationASR Evaluation

  9. LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition

    Apr 30, 2026Doyeop Kwak, Jeongsoo Choi, Suyeon Lee +1ASR EvaluationAutomatic Speech Recognition

  10. HATS: An Open data set Integrating Human Perception Applied to the Evaluation of Automatic Speech Recognition Metrics

    Apr 30, 2026Thibault Bañeras Roux, Jane Wottawa, Mickael Rouvier +2ASR EvaluationHuman-in-the-Loop Evaluation

  11. Qualitative Evaluation of Language Model Rescoring in Automatic Speech Recognition

    Apr 30, 2026Thibault Bañeras-Roux, Mickaël Rouvier, Jane Wottawa +1ASR EvaluationAutomatic Speech Recognition

  12. Few-Shot Synthetic Accented Speech for ASR Fine-Tuning: What Helps and When?

    Apr 30, 2026Yurii Halychanskyi, Nimet Beyza Bozdag, Mark Hasegawa-Johnson +2Synthetic-to-Real Domain AdaptationSynthetic Data Augmentation

  13. Graph-Based Phonetic Error Correction of Noisy ASR

    Apr 29, 2026Pratik Rakesh Singh, Mohammadi Zaki, Aneesh Mukkamala +1Automatic Speech Recognition

  14. Multimodal LLMs are not all you need for Pediatric Speech Language Pathology

    Apr 29, 2026Darren Fürst, Sebastian Steindl, Ulrich SchäferAudio Representation LearningHealthcare

  15. Text-Utilization for Encoder-dominated Speech Recognition Models

    Apr 29, 2026Albert Zeyer, Tim Posielek, Ralf Schlüter +1Automatic Speech Recognition

  16. WhisperPipe: A Resource-Efficient Streaming Architecture for Real-Time Automatic Speech Recognition

    Apr 28, 2026Erfan Ramezani, Mohammad Mahdi Giahi, Mohammad Erfan Zarabadipour +2Streaming ASRSpeech Processing

  17. RAS: a Reliability Oriented Metric for Automatic Speech Recognition

    Apr 27, 2026Wenbin Huang, Yuhang Qiu, Bohan Li +5ASR EvaluationSelective Prediction

  18. Keyword spotting using convolutional neural network for speech recognition in Hindi

    Apr 26, 2026Saru Bharti, Pushparaj Mani PathakKeyword SpottingSpeech Processing

  19. Au-M-ol: A Unified Model for Medical Audio and Language Understanding

    Apr 25, 2026Meizhu Liu, Nistha Mitra, Paul Li +3Speech ProcessingAudio Understanding

  20. Prompting Whisper for Joint Speech Transcription and Diarization

    Apr 24, 2026Mariia Zamyrova, Henk van den HeuvelSpeech ProcessingAutomatic Speech Recognition

  21. Identifying and typifying demographic unfairness in phoneme-level embeddings of self-supervised speech recognition models

    Apr 24, 2026Felix Herron, Solange Rossato, Alexandre Allauzen +1Demographic Bias in ASRAutomatic Speech Recognition

  22. Advancing automatic speech recognition using feature fusion with self-supervised learning features: A case study on Fearless Steps Apollo corpus

    Apr 24, 2026Szu-Jui Chen, John H. L. HansenAutomatic Speech RecognitionSelf-Supervised Speech Representation Learning

  23. Evaluation of Automatic Speech Recognition Using Generative Large Language Models

    Apr 23, 2026Thibault Bañeras-Roux, Shashi Kumar, Driss Khalil +6ASR EvaluationAutomatic Speech Recognition

  24. Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition

    Apr 23, 2026Srishti Ginjala, Eric Fosler-Lussier, Christopher W. Myers +1ASR EvaluationDemographic Bias in ASR

  25. "This Wasn't Made for Me": Recentering User Experience and Emotional Impact in the Evaluation of ASR Bias

    Apr 22, 2026Siyu Liang, Alicia Beckford WassinkAlgorithmic FairnessDemographic Bias in ASR

  26. Aligning Stuttered-Speech Research with End-User Needs: Scoping Review, Survey, and Guidelines

    Apr 22, 2026Hawau Olamide Toyin, Mutiah Apampa, Toluwani Aremu +6Speech ProcessingAutomatic Speech Recognition