End-To-End Automatic Speech Recognition Models

Latest papers 23

All topics
CardsList
  1. ASR ensembling for phoneme intelligibility evaluation of speech anonymizers

    Sep 23, 2026Victor Ménestrel, Sebastian Möller, Slim Ouni +1Automatic Speech Recognition EvaluationEnd-To-End Automatic Speech Recognition Models

  2. Design of the IBM Granite 5.0 TurboCTC ASR Model

    Sep 17, 2026Brian Kingsbury, George Saon, Masayuki Suzuki +5End-To-End Automatic Speech Recognition ModelsMuon

  3. Merging the Knowledge of LLMs for Automatic Speech Recognition

    Sep 14, 2026Hayato Futami, Tatsuya KawaharaEnd-To-End Automatic Speech Recognition ModelsAutomatic Speech Recognition

  4. MoLGE: Mixture of Language Group Experts for Efficient Scaling of Massively Multilingual Speech Recognition

    Jul 27, 2026Sangmin Lee, Woojin Chung, Woongjib Choi +1Multilingual Automatic Speech RecognitionMultilingual Language Models

  5. Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic Systems

    Jul 13, 2026Sheng Li, Jing Li, Felix Schijve +2End-To-End Automatic Speech Recognition ModelsAutomatic Speech Recognition

  6. Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs

    Jul 7, 2026Albert Zeyer, Ralf Schlüter, Hermann NeySpeech-To-Text AlignmentEnd-To-End Automatic Speech Recognition Models

  7. Listen, Think, Transcribe: Continuous Latent Test-Time Scaling for ASR

    Jul 6, 2026Ho Lam Chung, Yiming Chen, Dau-Cheng Lyu +2End-To-End Automatic Speech Recognition ModelsWhisper-Large-V3

  8. Adapting Foundation ASR Models to Dysarthric Speech: A Case Study

    Jun 30, 2026Christian Huber, Laura Kernahan, Alexander WaibelEnd-To-End Automatic Speech Recognition ModelsDysarthric Speech

  9. Tone-Conditioned Curriculum Learning for Low-Resource Bantu Speech Recognition

    Jun 30, 2026Kesego Mokgosi, Vukosi Marivate, Sitwala Mundia +3African LanguagesEnd-To-End Automatic Speech Recognition Models

  10. Scaling Audio Models Efficiently: Joint Optimization of Scale, Resolution, Adaptation, Precision, and Sparsity

    Jun 22, 2026Vyom Agarwal, Mokshda Gangrade, Siddharth Pal +1End-To-End Automatic Speech Recognition ModelsSpeech Language Models

  11. When Multiple Scripts Matter: Evaluating ASR in Clinical Settings

    Jun 16, 2026Jean Seo, Minkyu Kim, Jeonguk Lee +3Automatic Speech Recognition EvaluationEnd-To-End Automatic Speech Recognition Models

  12. Listening with Attention: Entropy-Guided Explainability for Transformer-Based Audio Models

    Jun 12, 2026Ravi Ranjan, Utkarsh Grover, Xiaomin Lin +1End-To-End Automatic Speech Recognition ModelsNeural Audio

  13. Enhancing Multilingual LLM-based ASR with Mixture of Experts and Dynamic Downsampling

    Jun 9, 2026Guodong Lin, Ziqi Chen, Yuxiang Fu +2End-To-End Automatic Speech Recognition ModelsAutomatic Speech Recognition

  14. Beyond Waveform Robustness: Robust Feature-Vocoder Adversarial Attacks on Automatic Speech Recognition

    Jun 4, 2026Yifan Liao, Zongmin Zhang, Zhen Sun +3End-To-End Automatic Speech Recognition ModelsAutomatic Speech Recognition

  15. Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR

    May 14, 2026Ryo Magoshi, Takashi Maekaku, Yusuke ShinoharaSpeech-To-Text AlignmentFlow-Matching Text-To-Speech

  16. From Dispersion to Attraction: Spectral Dynamics of Hallucination Across Whisper Model Scales

    Mar 31, 2026Ivan Viakhirev, Kirill Borodin, Grach MkrtchianSpectralAttractors