Automatic Speech Recognition

Also known as ASR

Momentum

54 papers in the last four weeks, up 238% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 302

All topics
CardsList
  1. Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India

    Apr 21, 2026Kaushal Bhogale, Manas Dhir, Amritansh Walecha +11ASR EvaluationAutomatic Speech Recognition

  2. Reducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency Regularization

    Apr 21, 2026Andrei Andrusenko, Vladimir Bataev, Lilit Grigoryan +3Streaming ASRAutomatic Speech Recognition

  3. Where Do Self-Supervised Speech Models Become Unfair?

    Apr 20, 2026Felix Herron, Maja Hjuler, Solange Rossato +2Speech ProcessingDemographic Bias in ASR

  4. Hard to Be Heard: Phoneme-Level ASR Analysis of Phonologically Complex, Low-Resource Endangered Languages

    Apr 20, 2026V. S. D. S. Mahesh Akavarapu, Michael Daniel, Gerhard JägerASR EvaluationAutomatic Speech Recognition

  5. NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR

    Apr 20, 2026Yuan Xie, Jiaqi Song, Guang Qiu +9Streaming ASRAutomatic Speech Recognition

  6. MUSCAT: MUltilingual, SCientific ConversATion Benchmark

    Apr 17, 2026Supriti Sinhamahapatra, Thai-Binh Nguyen, Yiğit Oğuz +3Code-Switching Speech RecognitionASR Evaluation

  7. Closing the Speech-Text Gap with Limited Audio for Effective Domain Adaptation in LLM-Based ASR

    Apr 7, 2026Thibault Bañeras-Roux, Sergio Burdisso, Esaú Villatoro-Tello +9Domain Adaptation for ASRCross-Modal Alignment

  8. From Dispersion to Attraction: Spectral Dynamics of Hallucination Across Whisper Model Scales

    Mar 31, 2026Ivan Viakhirev, Kirill Borodin, Grach MkrtchianTransformer InterpretabilityAutomatic Speech Recognition

  9. An Empirical Recipe for Universal Phone Recognition

    Mar 30, 2026Shikhar Bharadwaj, Chin-Jou Li, Kwanghee Choi +4Automatic Speech RecognitionMultilingual ASR

  10. Beyond Acoustic Prefixes: Persistent Access to Serialized Acoustic Memory for LLM-Based Multi-Talker Speech Recognition

    Mar 28, 2026Hao Shi, Yuan Gao, Xugang Lu +1Memory-Augmented Language ModelsAutomatic Speech Recognition

  11. Attack-Dependent Robustness of Neural Audio Codecs for Adversarial ASR

    Mar 10, 2026Jordan Prescott, Thanathai Lertpetchpun, Shrikanth NarayananASR EvaluationNeural Audio Codecs

  12. Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios

    Mar 9, 2026Pol Buitrago, Javier HernandoSynthetic Data AugmentationAudio-Visual Representation Learning

  13. PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment

    Mar 9, 2026Bence Mark Halpern, Thomas Tienkamp, Defne Abur +1Benchmark DesignSpeech Quality Assessment

  14. Whisper-CD: Accurate Long-Form Speech Recognition using Multi-Negative Contrastive Decoding

    Mar 6, 2026Hoseong Ahn, Jeongyun Chae, Yoonji Park +1Language Model DecodingAutomatic Speech Recognition

  15. Measuring the Redundancy of Decoder Layers in SpeechLLMs

    Mar 5, 2026Adel Moumen, Guangzhi Sun, Philip C WoodlandLLM PruningTransformer

  16. When Audio Separation Hurts Zero-Shot ASR: Evaluating SAM-Audio with Whisper on Bengali and English Speech

    Mar 5, 2026Akif Islam, Raufun Nahar, Md. Ekramul HamidASR EvaluationAutomatic Speech Recognition

  17. ViMedCSS: A Vietnamese Medical Code-Switching Speech Dataset & Benchmark

    Feb 13, 2026Tung X. Nguyen, Nhu Vo, Giang-Son Nguyen +6Code-Switching Speech RecognitionAutomatic Speech Recognition

  18. Text-only adaptation in LLM-based ASR through text denoising

    Jan 28, 2026Andrés Carofilis, Sergio Burdisso, Esaú Villatoro-Tello +8Domain Adaptation for ASRDomain Adaptation

  19. PRiSM: Benchmarking Phone Realization in Speech Models

    Jan 20, 2026Shikhar Bharadwaj, Chin-Jou Li, Yoonjae Kim +13Automatic Speech RecognitionSpeech Language Models

  20. TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding

    Jan 11, 2026Mingyue Huo, Yiwen Shao, Yuheng ZhangAudio UnderstandingAutomatic Speech Recognition

  21. Pruning as Regularization: Sensitivity-Aware One-Shot Pruning in ASR

    Nov 11, 2025Julian Irigoyen, Arthur Söhler, Andreas Søeborg KirkedalAutomatic Speech RecognitionImplicit Regularization

  22. M-CIF: Multi-Scale Alignment For CIF-Based Non-Autoregressive ASR

    Oct 25, 2025Ruixiang Mao, Xiangnan Ma, Qing Yang +7Automatic Speech RecognitionMultilingual ASR

  23. Cross-Attention is Half Explanation in Speech-to-Text Models

    Sep 22, 2025Sara Papi, Dennis Fucci, Marco Gaido +2Transformer InterpretabilityCross-Attention

  24. WhisTLE: Deeply Supervised, Text-Only Domain Adaptation for Small Pretrained Speech Recognition Transformers

    Sep 12, 2025Akshat Pandey, Karun Kumar, Raphael TangDomain Adaptation for ASRDomain Adaptation

  25. Enabling automatic transcription of child-centered audio recordings from real-world environments

    Jun 13, 2025Daniil Kocharov, Azarias Galama, Okko RäsänenAutomatic Speech Recognition

  26. PERL: Pinyin Enhanced Rephrasing Language Model for Chinese ASR N-best Error Correction

    Dec 4, 2024Junhong Liang, Bojun ZhangControllable Text GenerationAutomatic Speech Recognition