Automatic Speech Recognition

Also known as ASR

Momentum

54 papers in the last four weeks, up 238% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 302

All topics
CardsList
  1. Breaking Adversarial Transferability in Fine-Tuned Speech Recognition

    Oct 6, 2026Mojtaba Nafez, Aref Mousavi, Mohammad Ebrahim Mahdavi +3Adversarial TransferabilityAutomatic Speech Recognition

  2. Phoneme-Guided Initialization for LLM-based Speech Recognition

    Oct 6, 2026Ryo Magoshi, Shinsuke Sakai, Tatsuya KawaharaAutomatic Speech RecognitionSpeech Language Models

  3. DirectSpeech2LLM: A Simple End-to-End Framework to Mitigate Prompt Overfitting in Speech-LLMs

    Oct 6, 2026Hemant Yadav, Sunayana Sitaram, Roger Zimmermann +1Automatic Speech RecognitionSpeech Language Models

  4. Automatic Speech Recognition for Low-Resource Sinhala: A Critical Review of Methods, Challenges, and Future Directions

    Oct 5, 2026Chanuka Dinuwan, Sanath Jayasena, Buddhika KarunarathneASR EvaluationAutomatic Speech Recognition

  5. AraYoungVoices: A Diverse L1/L2 Corpus of Arabic Child and Adolescent Speech

    Oct 4, 2026Shammur Absar Chowdhury, Zien Sheikh Ali, Houssam Eddine-Othman Lachemat +1Automatic Speech Recognition

  6. Toward Elastic Speech Inference: Training-Free Wake-Word Detection from Pretrained ASR

    Oct 1, 2026Hwayeon Kim, Youngwon Choi, Hyeonyu KimModel CompressionSpeech Processing

  7. FFASR: Benchmarking Far-Field Automatic Speech Recognition using High-Fidelity Simulated RIRs

    Sep 30, 2026Shivam Saini, Eric Bezzam, Georg Götz +5ASR EvaluationAutomatic Speech Recognition

  8. Talk2Agent: Benchmarking Voice Interfaces for Text Agents

    Sep 30, 2026Terumi Chiba, Guangzhi Sun, Zheqi Yuan +1ASR EvaluationVoice Agent Evaluation

  9. AS2^2D: Accelerating On-Demand Audio Understanding on Mobile Devices

    Sep 29, 2026Yunzhe Li, Kyoungjun Park, Hongzi Zhu +1On-Device Language Model InferenceLanguage Model Decoding

  10. Benchmarking Automatic Speech Recognition Tools for Iberian Languages

    Sep 29, 2026Fernando López, Pablo Gómez, David Solans +2ASR EvaluationAutomatic Speech Recognition

  11. BaLEEN: Biasing with Latent Encoded Entities for Context-Aware ASR

    Sep 29, 2026Chihiro Taguchi, Yotaro Kubo, Rujikorn CharakornDomain Adaptation for ASRAutomatic Speech Recognition

  12. Almieyar: A Culturally Grounded Benchmark for Multi-Dialect Arabic Speech Recognition

    Sep 28, 2026Omid Ghahroodi, Anas Madkoor, Dima Faris Al Saudi +37ASR EvaluationArabic NLP

  13. Latency and accuracy tradeoffs in Spiking Neural Networks

    Sep 28, 2026Zhanglu Yan, Zixuan Zhu, Kaiwen Tang +3Efficient Neural Network InferenceAutomatic Speech Recognition

  14. CARDAMOM: A Micro-Dialectal Arabic Speech Dataset for ASR

    Sep 28, 2026Bashar Talafha, Samar M. Magdy, Aisha Alansari +36ASR EvaluationArabic NLP

  15. Evaluating Machine Unlearning in ASR

    Sep 28, 2026Diogo Dinis, Francisco Teixeira, Bhiksha Raj +2Automatic Speech RecognitionMachine Unlearning

  16. In-Context Adaptation of Encoder-Decoder Models in Speech Recognition

    Sep 27, 2026Yen Meng, Sharon Goldwater, Hao TangDomain Adaptation for ASRAutomatic Speech Recognition

  17. Unified Target-Speaker ASR with Text and Enrollment Speech Cues

    Sep 27, 2026Yuxiang Mei, Yuchen Yan, Dongxing Xu +2Target Speaker ExtractionAutomatic Speech Recognition

  18. Audio LLMs Know When They Can't Hear You

    Sep 24, 2026Amirhosein Javadi, Richa Dixit, Mehrdad Farajtabar +3Audio-Language Model EvaluationLanguage Model Self-Assessment

  19. Pretrained ASR Pseudo-labeling for Noisy Police Audio

    Sep 24, 2026Kaavya Chaparala, Su Huang, Stephen L. Morgan +2Domain Adaptation for ASRAutomatic Speech Recognition

  20. A Training Criterion with Token-Level Tolerance to Transcription Ambiguity for Automatic Speech Recognition

    Sep 24, 2026Saurabh Kumar, Diptiman Mohanta, Prasanta Kumar GhoshAutomatic Speech Recognition

  21. STAM-ASR: Speaker-Temporal Anchoring with Memory for Multi-Speaker ASR

    Sep 24, 2026Victor Tolulope Olufemi, Syeda Faiza Ahmed Sara, Shammur Absar ChowdhuryAudio-Language ModelsAutomatic Speech Recognition

  22. Benchmarking and Domain Adaptation of Automatic Speech Recognition (ASR) for Adolescent Health Communication in Ghanaian Languages

    Sep 24, 2026Stephen E. Moore, Akwasi Asare, Mich-Seth Owusu +3ASR EvaluationDomain Adaptation for ASR

  23. TS-OPD: Reconciling ASR and QA in Speech Language Models via Task-Specific On-Policy Distillation

    Sep 24, 2026Yujie Guo, Hongjie Chen, Jian Kang +3Automatic Speech RecognitionOn-Policy Distillation

  24. agentic-ger: terminology recovery in long-form speech using global context

    Sep 24, 2026Yanqiao Zhu, Wupeng Wang, Zhifu Gao +2Automatic Speech Recognition

  25. Learning New Words from Unlabeled Test Data in Automatic Speech Recognition

    Sep 24, 2026Mengqi Wang, Mark A. Hasegawa-Johnson, Haolong Zheng +1Test-Time AdaptationDomain Adaptation for ASR

  26. Temporal Taxation Compounds Under Post-Training Compression of Whisper Models

    Sep 23, 2026Srishti Ginjala, Eric Fosler-Lussier, Christopher W. Myers +1ASR EvaluationSpeech Foundation Models

  27. PTC-Bias: Phoneme-Level Temporal Competition for Bias Retrieval and Post-Decoding Correction in Speech LLMs

    Sep 23, 2026Zhiqi Ai, Han Cheng, Shiyi Mu +2Automatic Speech RecognitionSpeech Language Models

  28. Six Layers Less: Encoder Pruning for Whisper with Label-Free Recovery

    Sep 23, 2026Rasmus Aagaard, Nicki Skafte DetlefsenSpeech Foundation ModelsAutomatic Speech Recognition

  29. End-to-end Jordanian dialect speech-to-text self-supervised learning framework

    Sep 21, 2026Ali A. Safieh, Ibrahim Abu Alhaol, Rawan GhnematAutomatic Speech RecognitionSelf-Supervised Speech Representation Learning

  30. NAVIR: Neuromorphic Audio-Visual Speech Recognition for Robust Human-Robot Interaction on Edge Hardware

    Sep 21, 2026Leonidas Delimpasis, Panagiota Moraiti, Antonis Porichis +2Visual Speaker RecognitionAutomatic Speech Recognition

  31. Vimarsha: Faithful ASR Evaluation for Indian Languages with Demographic Diversity, In-the-Wild Audio and Spelling Variations

    Sep 21, 2026Kaushal Santosh Bhogale, Srija Anand, Sadakopa Ramakrishnan Thothathiri +3ASR EvaluationDemographic Bias in ASR

  32. Beyond Encoder Fusion: Multi-View Discrete Token Augmentation for LLM-Based ASR

    Sep 20, 2026Paul Moïse Gangbadja, Mickael Rouvier, Fabrice LefèvreMulti-View LearningAutomatic Speech Recognition

  33. Long-Tail Rebalancing for Non-Verbal Vocalization-Aware ASR: A Track 1 System for the NVVSpeech Challenge

    Sep 20, 2026Shangyue Jia, Jingru Ma, Yangzhuo Li +9Long-Tail LearningAutomatic Speech Recognition

  34. Design of the IBM Granite 5.0 TurboCTC ASR Model

    Sep 17, 2026Brian Kingsbury, George Saon, Masayuki Suzuki +5TransformerAutomatic Speech Recognition

  35. HearInContext: A Benchmark for Implicit Context in Speech Recognition

    Sep 16, 2026Yifan Gao, Yao Tian, Hongbin SuoASR EvaluationAutomatic Speech Recognition

  36. A Probe Shift Is Not a Fairness Fix: The Limits of Representation Steering in Speech Models

    Sep 16, 2026Nicolas Bourrel, Abderrahmane Issam, Gerasimos SpanakisASR EvaluationDemographic Bias in ASR

  37. Align, Integrate, and Fire: Efficient Token-Level Alignment for Zero-Shot SpeechLLMs

    Sep 16, 2026Abderrahmane Issam, Yusuf Can Semerci, Jan Scholtes +1Speech TranslationAutomatic Speech Recognition

  38. T-SANDHI: Tone Sandhi-aware Adaptive Network with Decoupled Hybrid Injection for Low-resource Taiwanese Hokkien Speech Recognition

    Sep 16, 2026Hung-Yang Sung, Chien-Chun Wang, Tien-Hong Lo +3Automatic Speech RecognitionSpeech Prosody

  39. Encoder Awakening via Adapters: Effective Domain-Adaptive Fine-tuning of Speech-LLMs

    Sep 16, 2026Mohan Shi, Zilai Wang, Natarajan Balaji Shankar +3Domain Adaptation for ASRAdapter Tuning

  40. DiaWhisper-DPO: Role-Attributed Transcription of Clinical Interviews via Failure-Mined Preference Optimization

    Sep 15, 2026Weiming Li, Ana Catarina Fidalgo Barata, Miguel Constante +1Automatic Speech RecognitionSpeaker Diarization

  41. Merging the Knowledge of LLMs for Automatic Speech Recognition

    Sep 14, 2026Hayato Futami, Tatsuya KawaharaDomain Adaptation for ASRAutomatic Speech Recognition

  42. Typhoon ASR Streaming: Steerable Low-Latency Thai Speech Recognition with Real-Time Shallow Fusion

    Sep 14, 2026Warit Sirichotedumrong, Tanawin Samutsin, Shah Faisal Wani +2Streaming ASRAutomatic Speech Recognition

  43. Whisper-Based Speech Transcription from Videos Across Multiple Languages for Cross-Cultural Understanding

    Sep 11, 2026Michael PichenyDomain Adaptation for ASRAutomatic Speech Recognition

  44. Automatic Lyric Transcription for Greek Songs: Scaling and Task Composition Effects in Whisper Adaptation

    Sep 11, 2026Maria Frangiadaki, Dimitrios Damianos, Kosmas Kritsis +1Domain Adaptation for ASRMulti-Task Learning

  45. Xiaomi-CocktailASR-1 Technical Report

    Sep 11, 2026Yiru Zhang, Hang Su, Lichun Fan +10Automatic Speech RecognitionSpeech Language Models

  46. Candor-LR: A Dyadic Conversational Dataset for Audio-Visual Speech Recognition

    Sep 9, 2026Rishabh Jain, Aristeidis Papadopoulos, Zhaofeng Lin +1Automatic Speech RecognitionAudio-Visual Speech Recognition

  47. Pushing the Boundaries of Streaming Multi-Speaker ASR: A Systematic Study of Architectural Trade-offs

    Sep 9, 2026Taejin Park, Ivan Medennikov, Kunal Dhawan +3Streaming ASRAutomatic Speech Recognition

  48. NOPE-HYPE: A Structured Simulation Workflow for Robust Speech-to-Text Across Diverse Acoustic Environments

    Sep 9, 2026Niramay M. Patel, Bibek Behera, Raksha SharmaSpeech TranslationAutomatic Speech Recognition

  49. Orukeet: Multilingual ASR with Frozen Gabor Kernels

    Sep 9, 2026Nathan Roll, Irene Yi, Büşra Marşan +6Automatic Speech RecognitionMultilingual ASR

  50. Leveraging Fine-grained Error Correction in Korean Speech Recognition for Consultation Services

    Sep 9, 2026Yonghyun Jun, Jimin Lee, Hwan Chang +3Automatic Speech RecognitionLow-Resource Language Processing

  51. BuzzASR: A Swarm of 100+ Monolingual Speech Recognition Models

    Sep 9, 2026Shivam Singh, Aditya Yadavalli, Catherine Arnett +1Speech Foundation ModelsAutomatic Speech Recognition