Automatic Speech Recognition

Also known as ASR

Momentum

54 papers in the last four weeks, up 238% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 302

All topics
CardsList
  1. Scaling Conversational Hungarian ASR: The BEA-Dialogue+ Corpus

    May 29, 2026Máté Gedeon, Piroska Zsófia Barta, Péter Mihajlik +1Automatic Speech RecognitionLow-Resource Speech Recognition

  2. Subtitle-Aligned Fine-Tuning of Whisper for Swiss German ASR: Benchmark Contamination, Convention Mismatch, and an Honest Baseline at 25.6% WER (13.8% cWER)

    May 29, 2026Felix AkeretASR EvaluationFine-Tuning

  3. Your Multimodal Speech Model Says I Have a Face for Radio

    May 28, 2026Maya K. Nachesa, Vlad Niculae, Vagrant GautamASR EvaluationDemographic Bias in ASR

  4. MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables

    May 28, 2026Sung-Lin Yeh, Wei Zhou, Gil Keren +6Audio Representation LearningAutoregressive Language Modeling

  5. Decoding Strategies for Diffusion-Based ASR: A Systematic Evaluation of Confidence-Based Thresholding

    May 28, 2026Jeong Hun Yeo, Minsu Kim, Hyeongseop Rha +1Language Model DecodingAutomatic Speech Recognition

  6. Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation

    May 28, 2026Zixuan Jiang, Yanqiao Zhu, Peng Wang +8Automatic Speech Recognition

  7. ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood

    May 28, 2026Tiantian Feng, Anfeng Xu, Xuan Shi +10Audio-Language Model EvaluationSpeech Quality Assessment

  8. Breaking the Script Barrier: Enabling Automatic Alignment for PoS-based ASR Error Analysis in Non-Latin Scripts

    May 27, 2026Prasenjit K Mudi, Dahlia Devapriya, Sheetal KalyaniAutomatic Speech Recognition

  9. Building Community-Centred NLP Resources for Puno Quechua

    May 27, 2026Elwin Huaman, Adrian Gamarra Lafuente, Johanna Cordova +1Automatic Speech RecognitionLow-Resource Language Processing

  10. When Helpful Context Leaks: Privacy Risks in Domain-Adapted ASR

    May 27, 2026Maike Züfle, Jan NiehuesData LeakageDomain Adaptation for ASR

  11. Beyond Phones: Structured Phonemic Modeling for Vietnamese Automatic Speech Recognition

    May 27, 2026Nghia Hieu Nguyen, Quan Ngoc Hoang, Long Hoang Huu Nguyen +2Automatic Speech Recognition

  12. TARQ: Tail-Aware Reconstruction Quantization for Rare-Word Robust Automatic Speech Recognition

    May 27, 2026Xinyu Wang, Ziyu Zhao, Ke Bai +4Automatic Speech RecognitionPost-Training Quantization

  13. FalAR: A Large-scale Speaker-Annotated European Portuguese Speech Corpus of Parliamentary Sessions

    May 26, 2026Francisco Teixeira, Carlos Carvalho, Mariana Julião +7Automatic Speech RecognitionLow-Resource Speech Recognition

  14. Proactive for Uncertainty: Cause-Aware Error Diagnosis and Interactive Clarification for Spoken Dialogue Systems

    May 25, 2026Yizhou Peng, Ziyang Ma, Changsong Liu +3Spoken Dialogue SystemsAutomatic Speech Recognition

  15. Phonetic Modeling of Dialectal Variation in Vietnamese Speech

    May 23, 2026Quan Ngoc Hoang, Long Hoang Huu Nguyen, Nghia Hieu Nguyen +2Speech ProcessingAutomatic Speech Recognition

  16. End-to-End Intracortical Speech Decoding from Neural Activity

    May 23, 2026Owais Mujtaba Khanday, Jose A. Gonzalez-Lopez, Marc Ouellet +2Brain-Computer InterfacesNeural Decoding

  17. SCRIBE: Diagnostic Evaluation and Rich Transcription Models for Indic ASR

    May 20, 2026Kavya Manohar, Arghya Bhattacharya, Kush Juvekar +1ASR EvaluationAutomatic Speech Recognition

  18. FormalASR: End-to-End Spoken Chinese to Formal Text

    May 19, 2026Wanyi Ning, Yinshang Guo, Haitao Qian +3Speech ProcessingAutomatic Speech Recognition

  19. PAREDA: A Multi-Accent Speech Dataset of Natural Language Processing Research Discussions

    May 18, 2026Sicheng Jin, Dipankar Srirag, Aditya JoshiASR EvaluationSpeech Processing

  20. Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades

    May 17, 2026Donghyuk Jung, Youngwon ChoiAudio-Language Model EvaluationQuestion Answering

  21. JSPG: Dynamic Dictionary Filtering via Joint Semantic-Pinyin-Glyph Retrieval for Chinese Contextual ASR

    May 16, 2026Shilin Zhou, Zhenghua LiAutomatic Speech RecognitionSequence Alignment

  22. Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR

    May 14, 2026Ryo Magoshi, Takashi Maekaku, Yusuke ShinoharaDomain Adaptation for ASRDomain Adaptation

  23. Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs

    May 13, 2026Trung Nguyen Quang, Cheng Yi Lewis Won, Minh Duc Pham +3Code-Switching Speech RecognitionAudio-Language Models