Automatic Speech Recognition

Also known as ASR

Momentum

54 papers in the last four weeks, up 238% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 305

All topics
CardsList
  1. agentic-ger: terminology recovery in long-form speech using global context

    Sep 24, 2026Yanqiao Zhu, Wupeng Wang, Zhifu Gao +2Automatic Speech Recognition

  2. Learning New Words from Unlabeled Test Data in Automatic Speech Recognition

    Sep 24, 2026Mengqi Wang, Mark A. Hasegawa-Johnson, Haolong Zheng +1Test-Time AdaptationDomain Adaptation for ASR

  3. Temporal Taxation Compounds Under Post-Training Compression of Whisper Models

    Sep 23, 2026Srishti Ginjala, Eric Fosler-Lussier, Christopher W. Myers +1ASR EvaluationSpeech Foundation Models

  4. PTC-Bias: Phoneme-Level Temporal Competition for Bias Retrieval and Post-Decoding Correction in Speech LLMs

    Sep 23, 2026Zhiqi Ai, Han Cheng, Shiyi Mu +2Automatic Speech RecognitionSpeech Language Models

  5. Six Layers Less: Encoder Pruning for Whisper with Label-Free Recovery

    Sep 23, 2026Rasmus Aagaard, Nicki Skafte DetlefsenSpeech Foundation ModelsAutomatic Speech Recognition

  6. End-to-end Jordanian dialect speech-to-text self-supervised learning framework

    Sep 21, 2026Ali A. Safieh, Ibrahim Abu Alhaol, Rawan GhnematAutomatic Speech RecognitionSelf-Supervised Speech Representation Learning

  7. NAVIR: Neuromorphic Audio-Visual Speech Recognition for Robust Human-Robot Interaction on Edge Hardware

    Sep 21, 2026Leonidas Delimpasis, Panagiota Moraiti, Antonis Porichis +2Visual Speaker RecognitionAutomatic Speech Recognition

  8. Vimarsha: Faithful ASR Evaluation for Indian Languages with Demographic Diversity, In-the-Wild Audio and Spelling Variations

    Sep 21, 2026Kaushal Santosh Bhogale, Srija Anand, Sadakopa Ramakrishnan Thothathiri +3ASR EvaluationDemographic Bias in ASR

  9. Beyond Encoder Fusion: Multi-View Discrete Token Augmentation for LLM-Based ASR

    Sep 20, 2026Paul Moïse Gangbadja, Mickael Rouvier, Fabrice LefèvreMulti-View LearningAutomatic Speech Recognition

  10. Long-Tail Rebalancing for Non-Verbal Vocalization-Aware ASR: A Track 1 System for the NVVSpeech Challenge

    Sep 20, 2026Shangyue Jia, Jingru Ma, Yangzhuo Li +9Long-Tail LearningAutomatic Speech Recognition

  11. Design of the IBM Granite 5.0 TurboCTC ASR Model

    Sep 17, 2026Brian Kingsbury, George Saon, Masayuki Suzuki +5TransformerAutomatic Speech Recognition

  12. HearInContext: A Benchmark for Implicit Context in Speech Recognition

    Sep 16, 2026Yifan Gao, Yao Tian, Hongbin SuoASR EvaluationAutomatic Speech Recognition

  13. A Probe Shift Is Not a Fairness Fix: The Limits of Representation Steering in Speech Models

    Sep 16, 2026Nicolas Bourrel, Abderrahmane Issam, Gerasimos SpanakisASR EvaluationDemographic Bias in ASR

  14. Align, Integrate, and Fire: Efficient Token-Level Alignment for Zero-Shot SpeechLLMs

    Sep 16, 2026Abderrahmane Issam, Yusuf Can Semerci, Jan Scholtes +1Speech TranslationAutomatic Speech Recognition

  15. T-SANDHI: Tone Sandhi-aware Adaptive Network with Decoupled Hybrid Injection for Low-resource Taiwanese Hokkien Speech Recognition

    Sep 16, 2026Hung-Yang Sung, Chien-Chun Wang, Tien-Hong Lo +3Automatic Speech RecognitionSpeech Prosody

  16. Encoder Awakening via Adapters: Effective Domain-Adaptive Fine-tuning of Speech-LLMs

    Sep 16, 2026Mohan Shi, Zilai Wang, Natarajan Balaji Shankar +3Domain Adaptation for ASRAdapter Tuning

  17. DiaWhisper-DPO: Role-Attributed Transcription of Clinical Interviews via Failure-Mined Preference Optimization

    Sep 15, 2026Weiming Li, Ana Catarina Fidalgo Barata, Miguel Constante +1Automatic Speech RecognitionSpeaker Diarization

  18. Merging the Knowledge of LLMs for Automatic Speech Recognition

    Sep 14, 2026Hayato Futami, Tatsuya KawaharaDomain Adaptation for ASRAutomatic Speech Recognition

  19. Typhoon ASR Streaming: Steerable Low-Latency Thai Speech Recognition with Real-Time Shallow Fusion

    Sep 14, 2026Warit Sirichotedumrong, Tanawin Samutsin, Shah Faisal Wani +2Streaming ASRAutomatic Speech Recognition

  20. Xiaomi-CocktailASR-1 Technical Report

    Sep 11, 2026Yiru Zhang, Hang Su, Lichun Fan +10Automatic Speech RecognitionSpeech Language Models

  21. Automatic Lyric Transcription for Greek Songs: Scaling and Task Composition Effects in Whisper Adaptation

    Sep 11, 2026Maria Frangiadaki, Dimitrios Damianos, Kosmas Kritsis +1Domain Adaptation for ASRMulti-Task Learning

  22. Whisper-Based Speech Transcription from Videos Across Multiple Languages for Cross-Cultural Understanding

    Sep 11, 2026Michael PichenyDomain Adaptation for ASRAutomatic Speech Recognition

  23. Candor-LR: A Dyadic Conversational Dataset for Audio-Visual Speech Recognition

    Sep 9, 2026Rishabh Jain, Aristeidis Papadopoulos, Zhaofeng Lin +1Automatic Speech RecognitionAudio-Visual Speech Recognition

  24. Pushing the Boundaries of Streaming Multi-Speaker ASR: A Systematic Study of Architectural Trade-offs

    Sep 9, 2026Taejin Park, Ivan Medennikov, Kunal Dhawan +3Streaming ASRAutomatic Speech Recognition

  25. NOPE-HYPE: A Structured Simulation Workflow for Robust Speech-to-Text Across Diverse Acoustic Environments

    Sep 9, 2026Niramay M. Patel, Bibek Behera, Raksha SharmaSpeech TranslationAutomatic Speech Recognition

  26. Orukeet: Multilingual ASR with Frozen Gabor Kernels

    Sep 9, 2026Nathan Roll, Irene Yi, Büşra Marşan +6Automatic Speech RecognitionMultilingual ASR