Automatic Speech Recognition

Also known as ASR

Momentum

54 papers in the last four weeks, up 238% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 302

All topics
CardsList
  1. Temporal Taxation Compounds Under Post-Training Compression of Whisper Models

    Sep 23, 2026Srishti Ginjala, Eric Fosler-Lussier, Christopher W. Myers +1ASR EvaluationSpeech Foundation Models

  2. PTC-Bias: Phoneme-Level Temporal Competition for Bias Retrieval and Post-Decoding Correction in Speech LLMs

    Sep 23, 2026Zhiqi Ai, Han Cheng, Shiyi Mu +2Automatic Speech RecognitionSpeech Language Models

  3. Six Layers Less: Encoder Pruning for Whisper with Label-Free Recovery

    Sep 23, 2026Rasmus Aagaard, Nicki Skafte DetlefsenSpeech Foundation ModelsAutomatic Speech Recognition

  4. End-to-end Jordanian dialect speech-to-text self-supervised learning framework

    Sep 21, 2026Ali A. Safieh, Ibrahim Abu Alhaol, Rawan GhnematAutomatic Speech RecognitionSelf-Supervised Speech Representation Learning

  5. NAVIR: Neuromorphic Audio-Visual Speech Recognition for Robust Human-Robot Interaction on Edge Hardware

    Sep 21, 2026Leonidas Delimpasis, Panagiota Moraiti, Antonis Porichis +2Visual Speaker RecognitionAutomatic Speech Recognition

  6. Vimarsha: Faithful ASR Evaluation for Indian Languages with Demographic Diversity, In-the-Wild Audio and Spelling Variations

    Sep 21, 2026Kaushal Santosh Bhogale, Srija Anand, Sadakopa Ramakrishnan Thothathiri +3ASR EvaluationDemographic Bias in ASR

  7. Beyond Encoder Fusion: Multi-View Discrete Token Augmentation for LLM-Based ASR

    Sep 20, 2026Paul Moïse Gangbadja, Mickael Rouvier, Fabrice LefèvreMulti-View LearningAutomatic Speech Recognition

  8. Long-Tail Rebalancing for Non-Verbal Vocalization-Aware ASR: A Track 1 System for the NVVSpeech Challenge

    Sep 20, 2026Shangyue Jia, Jingru Ma, Yangzhuo Li +9Long-Tail LearningAutomatic Speech Recognition

  9. Design of the IBM Granite 5.0 TurboCTC ASR Model

    Sep 17, 2026Brian Kingsbury, George Saon, Masayuki Suzuki +5TransformerAutomatic Speech Recognition

  10. HearInContext: A Benchmark for Implicit Context in Speech Recognition

    Sep 16, 2026Yifan Gao, Yao Tian, Hongbin SuoASR EvaluationAutomatic Speech Recognition

  11. A Probe Shift Is Not a Fairness Fix: The Limits of Representation Steering in Speech Models

    Sep 16, 2026Nicolas Bourrel, Abderrahmane Issam, Gerasimos SpanakisASR EvaluationDemographic Bias in ASR

  12. Align, Integrate, and Fire: Efficient Token-Level Alignment for Zero-Shot SpeechLLMs

    Sep 16, 2026Abderrahmane Issam, Yusuf Can Semerci, Jan Scholtes +1Speech TranslationAutomatic Speech Recognition

  13. T-SANDHI: Tone Sandhi-aware Adaptive Network with Decoupled Hybrid Injection for Low-resource Taiwanese Hokkien Speech Recognition

    Sep 16, 2026Hung-Yang Sung, Chien-Chun Wang, Tien-Hong Lo +3Automatic Speech RecognitionSpeech Prosody

  14. Encoder Awakening via Adapters: Effective Domain-Adaptive Fine-tuning of Speech-LLMs

    Sep 16, 2026Mohan Shi, Zilai Wang, Natarajan Balaji Shankar +3Domain Adaptation for ASRAdapter Tuning

  15. DiaWhisper-DPO: Role-Attributed Transcription of Clinical Interviews via Failure-Mined Preference Optimization

    Sep 15, 2026Weiming Li, Ana Catarina Fidalgo Barata, Miguel Constante +1Automatic Speech RecognitionSpeaker Diarization

  16. Merging the Knowledge of LLMs for Automatic Speech Recognition

    Sep 14, 2026Hayato Futami, Tatsuya KawaharaDomain Adaptation for ASRAutomatic Speech Recognition

  17. Typhoon ASR Streaming: Steerable Low-Latency Thai Speech Recognition with Real-Time Shallow Fusion

    Sep 14, 2026Warit Sirichotedumrong, Tanawin Samutsin, Shah Faisal Wani +2Streaming ASRAutomatic Speech Recognition

  18. Xiaomi-CocktailASR-1 Technical Report

    Sep 11, 2026Yiru Zhang, Hang Su, Lichun Fan +10Automatic Speech RecognitionSpeech Language Models

  19. Automatic Lyric Transcription for Greek Songs: Scaling and Task Composition Effects in Whisper Adaptation

    Sep 11, 2026Maria Frangiadaki, Dimitrios Damianos, Kosmas Kritsis +1Domain Adaptation for ASRMulti-Task Learning

  20. Whisper-Based Speech Transcription from Videos Across Multiple Languages for Cross-Cultural Understanding

    Sep 11, 2026Michael PichenyDomain Adaptation for ASRAutomatic Speech Recognition

  21. Candor-LR: A Dyadic Conversational Dataset for Audio-Visual Speech Recognition

    Sep 9, 2026Rishabh Jain, Aristeidis Papadopoulos, Zhaofeng Lin +1Automatic Speech RecognitionAudio-Visual Speech Recognition

  22. Pushing the Boundaries of Streaming Multi-Speaker ASR: A Systematic Study of Architectural Trade-offs

    Sep 9, 2026Taejin Park, Ivan Medennikov, Kunal Dhawan +3Streaming ASRAutomatic Speech Recognition

  23. NOPE-HYPE: A Structured Simulation Workflow for Robust Speech-to-Text Across Diverse Acoustic Environments

    Sep 9, 2026Niramay M. Patel, Bibek Behera, Raksha SharmaSpeech TranslationAutomatic Speech Recognition

  24. Orukeet: Multilingual ASR with Frozen Gabor Kernels

    Sep 9, 2026Nathan Roll, Irene Yi, Büşra Marşan +6Automatic Speech RecognitionMultilingual ASR

  25. Leveraging Fine-grained Error Correction in Korean Speech Recognition for Consultation Services

    Sep 9, 2026Yonghyun Jun, Jimin Lee, Hwan Chang +3Automatic Speech RecognitionLow-Resource Language Processing

  26. BuzzASR: A Swarm of 100+ Monolingual Speech Recognition Models

    Sep 9, 2026Shivam Singh, Aditya Yadavalli, Catherine Arnett +1Speech Foundation ModelsAutomatic Speech Recognition