Automatic Speech Recognition

Latest papers 207

All topics
CardsList
  1. WhisperPipe: A Resource-Efficient Streaming Architecture for Real-Time Automatic Speech Recognition

    Apr 28, 2026Erfan Ramezani, Mohammad Mahdi Giahi, Mohammad Erfan Zarabadipour +2Whisper-Large-V3Automatic Speech Recognition

  2. RAS: a Reliability Oriented Metric for Automatic Speech Recognition

    Apr 27, 2026Wenbin Huang, Yuhang Qiu, Bohan Li +5Automatic Speech RecognitionTranscription

  3. Advancing automatic speech recognition using feature fusion with self-supervised learning features: A case study on Fearless Steps Apollo corpus

    Apr 24, 2026Szu-Jui Chen, John H. L. HansenSelf-Supervised Speech ModelsSelf-Supervised Learning

  4. Evaluation of Automatic Speech Recognition Using Generative Large Language Models

    Apr 23, 2026Thibault Bañeras-Roux, Shashi Kumar, Driss Khalil +6Automatic Speech Recognition EvaluationAutomatic Speech Recognition

  5. Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India

    Apr 21, 2026Kaushal Bhogale, Manas Dhir, Amritansh Walecha +11Automatic Speech Recognition EvaluationAutomatic Speech Recognition

  6. Reducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency Regularization

    Apr 21, 2026Andrei Andrusenko, Vladimir Bataev, Lilit Grigoryan +3Automatic Speech RecognitionStreaming

  7. Hard to Be Heard: Phoneme-Level ASR Analysis of Phonologically Complex, Low-Resource Endangered Languages

    Apr 20, 2026V. S. D. S. Mahesh Akavarapu, Michael Daniel, Gerhard JägerGrapheme-To-PhonemeWav2Vec

  8. Efficient Punctuation Restoration via Weighted Lookahead Scoring Method for Streaming ASR Systems

    Apr 18, 2026Sungmook Woo, Hyungu Kang, Chanwoo KimAutomatic Speech RecognitionData Generation

  9. MUSCAT: MUltilingual, SCientific ConversATion Benchmark

    Apr 17, 2026Supriti Sinhamahapatra, Thai-Binh Nguyen, Yiğit Oğuz +3Multilingual Automatic Speech RecognitionMultilingual Benchmark

  10. Closing the Speech-Text Gap with Limited Audio for Effective Domain Adaptation in LLM-Based ASR

    Apr 7, 2026Thibault Bañeras-Roux, Sergio Burdisso, Esaú Villatoro-Tello +9Automatic Speech RecognitionSpeech Encoder

  11. RelayS2S: A Dual-Path Speculative Generation for Real-Time Dialogue

    Mar 24, 2026Long Mai, Junli LiangFull-Duplex Speech ModelsAutomatic Speech Recognition

  12. SeaAlert: Robust Severity Classification and LLM-Based Information Extraction for Noisy Maritime Distress Communications

    Mar 23, 2026Tomer Atia, Yehudit Aperstein, Alexander ApartsinMaritime NavigationDistress

  13. Attack-Dependent Robustness of Neural Audio Codecs for Adversarial ASR

    Mar 10, 2026Jordan Prescott, Thanathai Lertpetchpun, Shrikanth NarayananNeural Audio CodecsAutomatic Speech Recognition

  14. Whisper-CD: Accurate Long-Form Speech Recognition using Multi-Negative Contrastive Decoding

    Mar 6, 2026Hoseong Ahn, Jeongyun Chae, Yoonji Park +1Whisper-Large-V3Automatic Speech Recognition

  15. When Audio Separation Hurts Zero-Shot ASR: Evaluating SAM-Audio with Whisper on Bengali and English Speech

    Mar 5, 2026Akif Islam, Raufun Nahar, Md. Ekramul HamidAutomatic Speech RecognitionSpeech Separation

  16. ViMedCSS: A Vietnamese Medical Code-Switching Speech Dataset & Benchmark

    Feb 13, 2026Tung X. Nguyen, Nhu Vo, Giang-Son Nguyen +6Code-SwitchingAutomatic Speech Recognition

  17. Text-only adaptation in LLM-based ASR through text denoising

    Jan 28, 2026Andrés Carofilis, Sergio Burdisso, Esaú Villatoro-Tello +8Automatic Speech RecognitionLarge Language Model Adaptation

  18. Pruning as Regularization: Sensitivity-Aware One-Shot Pruning in ASR

    Nov 11, 2025Julian Irigoyen, Arthur Söhler, Andreas Søeborg KirkedalAutomatic Speech RecognitionRegularization

  19. Balalaika: Data-Centric, Prosody-Aware Annotation Pipeline for Russian Speech

    Jul 17, 2025Kirill Borodin, Nikita Vasiliev, Vasiliy Kudryavtsev +3ProsodyAutomatic Speech Recognition

  20. Enabling automatic transcription of child-centered audio recordings from real-world environments

    Jun 13, 2025Daniil Kocharov, Azarias Galama, Okko RäsänenTranscriptTranscription

  21. BaltiVoice: A Speech Corpus and Fine-tuned Whisper ASR System for the Balti Language

    Date pendingMuhammad AliWhisper-Large-V3Automatic Speech Recognition