Automatic Speech Recognition

Also known as ASR

Momentum

54 papers in the last four weeks, up 238% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 302

All topics
CardsList
  1. Pretrained self-supervised speech models can recognize unseen consonants

    Jun 10, 2026Chihiro Taguchi, Éric Le Ferrand, Hirosi Nakagawa +4Automatic Speech RecognitionSelf-Supervised Speech Representation Learning

  2. Massive Open-Vocabulary Keyword Spotting

    Jun 9, 2026Leonor Barreiros, Raul Monteiro, Afonso Mendes +1Keyword SpottingAutomatic Speech Recognition

  3. Speaker Group Encoding in Self-supervised Speech Recognition Models

    Jun 9, 2026Felix Herron, Solange Rossato Alexandre Allauzen, Benoit Favre +1Audio Representation LearningDemographic Bias in ASR

  4. Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation

    Jun 9, 2026Xuanchen Li, Tianrui Wang, Yuheng Lu +11Speech TranslationAutomatic Speech Recognition

  5. ViP-VL: Vietnamese Self-supervised Speech Pretraining Model with Vector-Quantization Learning

    Jun 9, 2026Khanh Le, Kiet Anh Hoang, Bao Nguyen +5Audio Representation LearningSpeech Processing

  6. Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs

    Jun 8, 2026Ming-Hao Hsu, Yuxuan Hu, Shujie Liu +3Audio Representation LearningAudio Understanding

  7. TRADE: Transducer-Augmented Decoder for Speech LLM

    Jun 7, 2026Yun Tang, Shanil Puri, Shinji Watanabe +1Streaming ASRSpeech Processing

  8. Whisper Hallucination Detection and Mitigation via Hidden Representation Steering and Sparse AutoEncoders

    Jun 5, 2026Georgii Aparin, Vadim Popov, Tasnima Sadekova +1Audio-Language Model Hallucination DetectionSparse Autoencoders

  9. Assessing True Generalisability of Audio-Visual Speech Recognisers

    Jun 5, 2026Zhaofeng Lin, Stavros Petridis, Maja Pantic +1Automatic Speech RecognitionAudio-Visual Speech Recognition

  10. Phonetic Error Analysis of Raw Waveform Acoustic Models

    Jun 5, 2026Erfan Loweimi, Zhengjun Yue, Andrea Carmantini +3ASR EvaluationSpeech Processing

  11. Contrastive Training with LLM-generated Near-Misses for Robust Code-Switching Speech Recognition

    Jun 5, 2026Tung X. Nguyen, Hieu Minh Truong, Giang Son Nguyen +3Code-Switching Speech RecognitionContrastive Learning

  12. Hearing the Unspoken: Language Model Priors for Acoustic Adversarial Attacks

    Jun 5, 2026Jiani Xie, Andrew C. Cullen, Paul Montague +1Streaming ASRAutomatic Speech Recognition

  13. Leveraging Soft Distributions of SSL-Derived Discrete Speech Tokens for Downstream Inference

    Jun 5, 2026Kentaro Onda, Satoru Fukayama, Daisuke Saito +1Automatic Speech RecognitionAudio Tokenization

  14. FiLM-Based Speaker Conditioning of a SpeechLLM for Pathological Speech Recognition

    Jun 4, 2026Fernando López, Santosh Kesiraju, Jordi LuqueAutomatic Speech RecognitionSpeech Language Models

  15. Multi-task Learning is Not Enough: Representational Entanglement in Dual-output Second Language Speech Recognition

    Jun 4, 2026Seung Hwan Cho, Young-Min KimDisentangled Representation LearningMulti-Task Learning

  16. Towards Truly Multilingual ASR: Generalizing Code-Switching ASR to Unseen Language Pairs

    Jun 4, 2026Gio Paik, Hyunseo Shin, Soungmin LeeCode-Switching Speech RecognitionDomain Generalization

  17. M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition

    Jun 4, 2026Fei Su, Cancan Li, Ming Li +1Multimodal RobustnessAudio-Visual Representation Learning

  18. Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy

    Jun 3, 2026Zhihan Li, Hankun Wang, Yiwei Guo +3ASR EvaluationAutomatic Speech Recognition

  19. Test-Time Compute Scaling for ASR with Depth-Conditioned Looped Transformers

    Jun 3, 2026Yacouba Kaloga, Shashi Kumar, Shakeel A. Sheikh +3Inference-Time ScalingTest-Time Scaling

  20. Efficient ASR Training with Conversations that Never Happened

    Jun 2, 2026Máté Gedeon, Péter MihajlikSynthetic Data AugmentationAutomatic Speech Recognition

  21. WAXAL-NET: Finetuned Edge ASR Across 19 African Languages

    Jun 1, 2026Victor Tolulope Olufemi, Oreoluwa Babatunde, Ramsey Njema +28ASR EvaluationDomain Adaptation for ASR

  22. MOSS-Audio Technical Report

    Jun 1, 2026Chen Yang, Chufan Yu, Hanfu Chen +27Audio UnderstandingAudio-Language Models

  23. MURMUR: An Efficient Inference System for Long-Form ASR

    May 31, 2026Wei-Tzu Lee, Keisuke Kamahori, Baris KasikciAutomatic Speech Recognition

  24. Spiking and Event-driven Neuromorphic Mamba Models for Efficient Speech Recognition

    May 31, 2026Tauseef Ahmed, Tao Sun, Jeronimo Castrillon +2Efficient Neural Network InferenceMamba

  25. Beyond the Mouth: Upper-Face Affective Cues in Audiovisual Sentence Recognition under Acoustic Uncertainty

    May 30, 2026Zhou Yang, Yueyi YangMultimodal RobustnessAutomatic Speech Recognition

  26. LaSR: Context-Aware Speech Recognition via Latent Reasoning

    May 30, 2026Heyang Liu, Ziyang Cheng, Jiayi Huang +5Automatic Speech RecognitionSpeech Language Models

  27. SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors

    May 30, 2026Yekaterina Yegorova, Argyrios Gerogiannis, Haolong Zheng +3Language Model SteeringAutomatic Speech Recognition