Automatic Speech Recognition

Also known as ASR

Momentum

54 papers in the last four weeks, up 238% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 302

All topics
CardsList
  1. WASIL: In-the-Wild Arabic Spoken Interactions with LLMs

    May 9, 2026Zien Sheikh Ali, Hamdy Mubarak, Soon-Gyo Jung +3Voice Agent EvaluationArabic NLP

  2. Dolphin-CN-Dialect: Where Chinese Dialects Matter

    May 9, 2026Yangyang Meng, Huihang Zhong, Guodong Lin +6Streaming ASRAutomatic Speech Recognition

  3. Beyond Single Ground Truth: Reference Monism as Epistemic Injustice in ASR Evaluation

    May 8, 2026Anna Seo Gyeong Choi, Maria Teleki, James Caverlee +3ASR EvaluationAutomatic Speech Recognition

  4. Bangla-WhisperDiar: Fine-Tuning Whisper and PyAnnote for Bangla Long-Form Speech Recognition and Speaker Diarization

    May 6, 2026Mohammed Aman Bhuiyan, Md Sazzad Hossain Adib, Samiul Basir Bhuiyan +4Audio UnderstandingAutomatic Speech Recognition

  5. A Comprehensive Analysis of Tokenization and Self-Supervised Learning in End-to-End Automatic Speech Recognition applied on French Language

    May 5, 2026Thibault Bañeras-Roux, Mickael Rouvier, Jane Wottawa +1ASR EvaluationAutomatic Speech Recognition

  6. A Paradigm for Interpreting Metrics and Identifying Critical Errors in Automatic Speech Recognition

    May 5, 2026Thibault Bañeras-Roux, Mickael Rouvier, Jane Wottawa +1ASR EvaluationAutomatic Speech Recognition

  7. Contrastive Regularization for Accent-Robust ASR

    May 5, 2026Van-Phat Thai, Aradhya Dhruv, Duc-Thinh Pham +1Automatic Speech RecognitionSupervised Contrastive Learning

  8. When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition

    May 4, 2026Pehuén Moure, Niclas Pokel, Bilal Bounajma +4Audio-Language Model EvaluationASR Evaluation

  9. LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition

    Apr 30, 2026Doyeop Kwak, Jeongsoo Choi, Suyeon Lee +1ASR EvaluationAutomatic Speech Recognition

  10. HATS: An Open data set Integrating Human Perception Applied to the Evaluation of Automatic Speech Recognition Metrics

    Apr 30, 2026Thibault Bañeras Roux, Jane Wottawa, Mickael Rouvier +2ASR EvaluationHuman-in-the-Loop Evaluation

  11. Qualitative Evaluation of Language Model Rescoring in Automatic Speech Recognition

    Apr 30, 2026Thibault Bañeras-Roux, Mickaël Rouvier, Jane Wottawa +1ASR EvaluationAutomatic Speech Recognition

  12. Few-Shot Synthetic Accented Speech for ASR Fine-Tuning: What Helps and When?

    Apr 30, 2026Yurii Halychanskyi, Nimet Beyza Bozdag, Mark Hasegawa-Johnson +2Synthetic-to-Real Domain AdaptationSynthetic Data Augmentation

  13. Graph-Based Phonetic Error Correction of Noisy ASR

    Apr 29, 2026Pratik Rakesh Singh, Mohammadi Zaki, Aneesh Mukkamala +1Automatic Speech Recognition

  14. Multimodal LLMs are not all you need for Pediatric Speech Language Pathology

    Apr 29, 2026Darren Fürst, Sebastian Steindl, Ulrich SchäferAudio Representation LearningHealthcare

  15. Text-Utilization for Encoder-dominated Speech Recognition Models

    Apr 29, 2026Albert Zeyer, Tim Posielek, Ralf Schlüter +1Automatic Speech Recognition

  16. WhisperPipe: A Resource-Efficient Streaming Architecture for Real-Time Automatic Speech Recognition

    Apr 28, 2026Erfan Ramezani, Mohammad Mahdi Giahi, Mohammad Erfan Zarabadipour +2Streaming ASRSpeech Processing

  17. RAS: a Reliability Oriented Metric for Automatic Speech Recognition

    Apr 27, 2026Wenbin Huang, Yuhang Qiu, Bohan Li +5ASR EvaluationSelective Prediction

  18. Keyword spotting using convolutional neural network for speech recognition in Hindi

    Apr 26, 2026Saru Bharti, Pushparaj Mani PathakKeyword SpottingSpeech Processing

  19. Au-M-ol: A Unified Model for Medical Audio and Language Understanding

    Apr 25, 2026Meizhu Liu, Nistha Mitra, Paul Li +3Speech ProcessingAudio Understanding

  20. Prompting Whisper for Joint Speech Transcription and Diarization

    Apr 24, 2026Mariia Zamyrova, Henk van den HeuvelSpeech ProcessingAutomatic Speech Recognition

  21. Identifying and typifying demographic unfairness in phoneme-level embeddings of self-supervised speech recognition models

    Apr 24, 2026Felix Herron, Solange Rossato, Alexandre Allauzen +1Demographic Bias in ASRAutomatic Speech Recognition

  22. Advancing automatic speech recognition using feature fusion with self-supervised learning features: A case study on Fearless Steps Apollo corpus

    Apr 24, 2026Szu-Jui Chen, John H. L. HansenAutomatic Speech RecognitionSelf-Supervised Speech Representation Learning

  23. Evaluation of Automatic Speech Recognition Using Generative Large Language Models

    Apr 23, 2026Thibault Bañeras-Roux, Shashi Kumar, Driss Khalil +6ASR EvaluationAutomatic Speech Recognition

  24. Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition

    Apr 23, 2026Srishti Ginjala, Eric Fosler-Lussier, Christopher W. Myers +1ASR EvaluationDemographic Bias in ASR

  25. "This Wasn't Made for Me": Recentering User Experience and Emotional Impact in the Evaluation of ASR Bias

    Apr 22, 2026Siyu Liang, Alicia Beckford WassinkAlgorithmic FairnessDemographic Bias in ASR

  26. Aligning Stuttered-Speech Research with End-User Needs: Scoping Review, Survey, and Guidelines

    Apr 22, 2026Hawau Olamide Toyin, Mutiah Apampa, Toluwani Aremu +6Speech ProcessingAutomatic Speech Recognition

  27. Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India

    Apr 21, 2026Kaushal Bhogale, Manas Dhir, Amritansh Walecha +11ASR EvaluationAutomatic Speech Recognition

  28. Reducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency Regularization

    Apr 21, 2026Andrei Andrusenko, Vladimir Bataev, Lilit Grigoryan +3Streaming ASRAutomatic Speech Recognition

  29. Where Do Self-Supervised Speech Models Become Unfair?

    Apr 20, 2026Felix Herron, Maja Hjuler, Solange Rossato +2Speech ProcessingDemographic Bias in ASR

  30. Hard to Be Heard: Phoneme-Level ASR Analysis of Phonologically Complex, Low-Resource Endangered Languages

    Apr 20, 2026V. S. D. S. Mahesh Akavarapu, Michael Daniel, Gerhard JägerASR EvaluationAutomatic Speech Recognition

  31. NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR

    Apr 20, 2026Yuan Xie, Jiaqi Song, Guang Qiu +9Streaming ASRAutomatic Speech Recognition

  32. MUSCAT: MUltilingual, SCientific ConversATion Benchmark

    Apr 17, 2026Supriti Sinhamahapatra, Thai-Binh Nguyen, Yiğit Oğuz +3Code-Switching Speech RecognitionASR Evaluation

  33. Closing the Speech-Text Gap with Limited Audio for Effective Domain Adaptation in LLM-Based ASR

    Apr 7, 2026Thibault Bañeras-Roux, Sergio Burdisso, Esaú Villatoro-Tello +9Domain Adaptation for ASRCross-Modal Alignment

  34. From Dispersion to Attraction: Spectral Dynamics of Hallucination Across Whisper Model Scales

    Mar 31, 2026Ivan Viakhirev, Kirill Borodin, Grach MkrtchianTransformer InterpretabilityAutomatic Speech Recognition

  35. An Empirical Recipe for Universal Phone Recognition

    Mar 30, 2026Shikhar Bharadwaj, Chin-Jou Li, Kwanghee Choi +4Automatic Speech RecognitionMultilingual ASR

  36. Beyond Acoustic Prefixes: Persistent Access to Serialized Acoustic Memory for LLM-Based Multi-Talker Speech Recognition

    Mar 28, 2026Hao Shi, Yuan Gao, Xugang Lu +1Memory-Augmented Language ModelsAutomatic Speech Recognition

  37. Attack-Dependent Robustness of Neural Audio Codecs for Adversarial ASR

    Mar 10, 2026Jordan Prescott, Thanathai Lertpetchpun, Shrikanth NarayananASR EvaluationNeural Audio Codecs

  38. Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios

    Mar 9, 2026Pol Buitrago, Javier HernandoSynthetic Data AugmentationAudio-Visual Representation Learning

  39. PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment

    Mar 9, 2026Bence Mark Halpern, Thomas Tienkamp, Defne Abur +1Benchmark DesignSpeech Quality Assessment

  40. Whisper-CD: Accurate Long-Form Speech Recognition using Multi-Negative Contrastive Decoding

    Mar 6, 2026Hoseong Ahn, Jeongyun Chae, Yoonji Park +1Language Model DecodingAutomatic Speech Recognition

  41. Measuring the Redundancy of Decoder Layers in SpeechLLMs

    Mar 5, 2026Adel Moumen, Guangzhi Sun, Philip C WoodlandLLM PruningTransformer

  42. When Audio Separation Hurts Zero-Shot ASR: Evaluating SAM-Audio with Whisper on Bengali and English Speech

    Mar 5, 2026Akif Islam, Raufun Nahar, Md. Ekramul HamidASR EvaluationAutomatic Speech Recognition

  43. ViMedCSS: A Vietnamese Medical Code-Switching Speech Dataset & Benchmark

    Feb 13, 2026Tung X. Nguyen, Nhu Vo, Giang-Son Nguyen +6Code-Switching Speech RecognitionAutomatic Speech Recognition

  44. Text-only adaptation in LLM-based ASR through text denoising

    Jan 28, 2026Andrés Carofilis, Sergio Burdisso, Esaú Villatoro-Tello +8Domain Adaptation for ASRDomain Adaptation

  45. PRiSM: Benchmarking Phone Realization in Speech Models

    Jan 20, 2026Shikhar Bharadwaj, Chin-Jou Li, Yoonjae Kim +13Automatic Speech RecognitionSpeech Language Models

  46. TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding

    Jan 11, 2026Mingyue Huo, Yiwen Shao, Yuheng ZhangAudio UnderstandingAutomatic Speech Recognition

  47. Pruning as Regularization: Sensitivity-Aware One-Shot Pruning in ASR

    Nov 11, 2025Julian Irigoyen, Arthur Söhler, Andreas Søeborg KirkedalAutomatic Speech RecognitionImplicit Regularization

  48. M-CIF: Multi-Scale Alignment For CIF-Based Non-Autoregressive ASR

    Oct 25, 2025Ruixiang Mao, Xiangnan Ma, Qing Yang +7Automatic Speech RecognitionMultilingual ASR

  49. Cross-Attention is Half Explanation in Speech-to-Text Models

    Sep 22, 2025Sara Papi, Dennis Fucci, Marco Gaido +2Transformer InterpretabilityCross-Attention

  50. WhisTLE: Deeply Supervised, Text-Only Domain Adaptation for Small Pretrained Speech Recognition Transformers

    Sep 12, 2025Akshat Pandey, Karun Kumar, Raphael TangDomain Adaptation for ASRDomain Adaptation

  51. Enabling automatic transcription of child-centered audio recordings from real-world environments

    Jun 13, 2025Daniil Kocharov, Azarias Galama, Okko RäsänenAutomatic Speech Recognition

  52. PERL: Pinyin Enhanced Rephrasing Language Model for Chinese ASR N-best Error Correction

    Dec 4, 2024Junhong Liang, Bojun ZhangControllable Text GenerationAutomatic Speech Recognition