Automatic Speech Recognition

Also known as ASR

Momentum

54 papers in the last four weeks, up 238% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 302

All topics
CardsList
  1. Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation

    Jun 9, 2026Xuanchen Li, Tianrui Wang, Yuheng Lu +11Speech TranslationAutomatic Speech Recognition

  2. ViP-VL: Vietnamese Self-supervised Speech Pretraining Model with Vector-Quantization Learning

    Jun 9, 2026Khanh Le, Kiet Anh Hoang, Bao Nguyen +5Audio Representation LearningSpeech Processing

  3. Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs

    Jun 8, 2026Ming-Hao Hsu, Yuxuan Hu, Shujie Liu +3Audio Representation LearningAudio Understanding

  4. TRADE: Transducer-Augmented Decoder for Speech LLM

    Jun 7, 2026Yun Tang, Shanil Puri, Shinji Watanabe +1Streaming ASRSpeech Processing

  5. Whisper Hallucination Detection and Mitigation via Hidden Representation Steering and Sparse AutoEncoders

    Jun 5, 2026Georgii Aparin, Vadim Popov, Tasnima Sadekova +1Audio-Language Model Hallucination DetectionSparse Autoencoders

  6. Assessing True Generalisability of Audio-Visual Speech Recognisers

    Jun 5, 2026Zhaofeng Lin, Stavros Petridis, Maja Pantic +1Automatic Speech RecognitionAudio-Visual Speech Recognition

  7. Phonetic Error Analysis of Raw Waveform Acoustic Models

    Jun 5, 2026Erfan Loweimi, Zhengjun Yue, Andrea Carmantini +3ASR EvaluationSpeech Processing

  8. Contrastive Training with LLM-generated Near-Misses for Robust Code-Switching Speech Recognition

    Jun 5, 2026Tung X. Nguyen, Hieu Minh Truong, Giang Son Nguyen +3Code-Switching Speech RecognitionContrastive Learning

  9. Hearing the Unspoken: Language Model Priors for Acoustic Adversarial Attacks

    Jun 5, 2026Jiani Xie, Andrew C. Cullen, Paul Montague +1Streaming ASRAutomatic Speech Recognition

  10. Leveraging Soft Distributions of SSL-Derived Discrete Speech Tokens for Downstream Inference

    Jun 5, 2026Kentaro Onda, Satoru Fukayama, Daisuke Saito +1Automatic Speech RecognitionAudio Tokenization

  11. FiLM-Based Speaker Conditioning of a SpeechLLM for Pathological Speech Recognition

    Jun 4, 2026Fernando López, Santosh Kesiraju, Jordi LuqueAutomatic Speech RecognitionSpeech Language Models

  12. Multi-task Learning is Not Enough: Representational Entanglement in Dual-output Second Language Speech Recognition

    Jun 4, 2026Seung Hwan Cho, Young-Min KimDisentangled Representation LearningMulti-Task Learning

  13. Towards Truly Multilingual ASR: Generalizing Code-Switching ASR to Unseen Language Pairs

    Jun 4, 2026Gio Paik, Hyunseo Shin, Soungmin LeeCode-Switching Speech RecognitionDomain Generalization

  14. M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition

    Jun 4, 2026Fei Su, Cancan Li, Ming Li +1Multimodal RobustnessAudio-Visual Representation Learning

  15. Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy

    Jun 3, 2026Zhihan Li, Hankun Wang, Yiwei Guo +3ASR EvaluationAutomatic Speech Recognition

  16. Test-Time Compute Scaling for ASR with Depth-Conditioned Looped Transformers

    Jun 3, 2026Yacouba Kaloga, Shashi Kumar, Shakeel A. Sheikh +3Inference-Time ScalingTest-Time Scaling

  17. Efficient ASR Training with Conversations that Never Happened

    Jun 2, 2026Máté Gedeon, Péter MihajlikSynthetic Data AugmentationAutomatic Speech Recognition

  18. WAXAL-NET: Finetuned Edge ASR Across 19 African Languages

    Jun 1, 2026Victor Tolulope Olufemi, Oreoluwa Babatunde, Ramsey Njema +28ASR EvaluationDomain Adaptation for ASR

  19. MOSS-Audio Technical Report

    Jun 1, 2026Chen Yang, Chufan Yu, Hanfu Chen +27Audio UnderstandingAudio-Language Models

  20. MURMUR: An Efficient Inference System for Long-Form ASR

    May 31, 2026Wei-Tzu Lee, Keisuke Kamahori, Baris KasikciAutomatic Speech Recognition

  21. Spiking and Event-driven Neuromorphic Mamba Models for Efficient Speech Recognition

    May 31, 2026Tauseef Ahmed, Tao Sun, Jeronimo Castrillon +2Efficient Neural Network InferenceMamba

  22. Beyond the Mouth: Upper-Face Affective Cues in Audiovisual Sentence Recognition under Acoustic Uncertainty

    May 30, 2026Zhou Yang, Yueyi YangMultimodal RobustnessAutomatic Speech Recognition

  23. LaSR: Context-Aware Speech Recognition via Latent Reasoning

    May 30, 2026Heyang Liu, Ziyang Cheng, Jiayi Huang +5Automatic Speech RecognitionSpeech Language Models

  24. SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors

    May 30, 2026Yekaterina Yegorova, Argyrios Gerogiannis, Haolong Zheng +3Language Model SteeringAutomatic Speech Recognition

  25. Scaling Conversational Hungarian ASR: The BEA-Dialogue+ Corpus

    May 29, 2026Máté Gedeon, Piroska Zsófia Barta, Péter Mihajlik +1Automatic Speech RecognitionLow-Resource Speech Recognition

  26. Subtitle-Aligned Fine-Tuning of Whisper for Swiss German ASR: Benchmark Contamination, Convention Mismatch, and an Honest Baseline at 25.6% WER (13.8% cWER)

    May 29, 2026Felix AkeretASR EvaluationFine-Tuning

  27. Your Multimodal Speech Model Says I Have a Face for Radio

    May 28, 2026Maya K. Nachesa, Vlad Niculae, Vagrant GautamASR EvaluationDemographic Bias in ASR

  28. MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables

    May 28, 2026Sung-Lin Yeh, Wei Zhou, Gil Keren +6Audio Representation LearningAutoregressive Language Modeling

  29. Decoding Strategies for Diffusion-Based ASR: A Systematic Evaluation of Confidence-Based Thresholding

    May 28, 2026Jeong Hun Yeo, Minsu Kim, Hyeongseop Rha +1Language Model DecodingAutomatic Speech Recognition

  30. Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation

    May 28, 2026Zixuan Jiang, Yanqiao Zhu, Peng Wang +8Automatic Speech Recognition

  31. ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood

    May 28, 2026Tiantian Feng, Anfeng Xu, Xuan Shi +10Audio-Language Model EvaluationSpeech Quality Assessment

  32. Breaking the Script Barrier: Enabling Automatic Alignment for PoS-based ASR Error Analysis in Non-Latin Scripts

    May 27, 2026Prasenjit K Mudi, Dahlia Devapriya, Sheetal KalyaniAutomatic Speech Recognition

  33. Building Community-Centred NLP Resources for Puno Quechua

    May 27, 2026Elwin Huaman, Adrian Gamarra Lafuente, Johanna Cordova +1Automatic Speech RecognitionLow-Resource Language Processing

  34. When Helpful Context Leaks: Privacy Risks in Domain-Adapted ASR

    May 27, 2026Maike Züfle, Jan NiehuesData LeakageDomain Adaptation for ASR

  35. Beyond Phones: Structured Phonemic Modeling for Vietnamese Automatic Speech Recognition

    May 27, 2026Nghia Hieu Nguyen, Quan Ngoc Hoang, Long Hoang Huu Nguyen +2Automatic Speech Recognition

  36. TARQ: Tail-Aware Reconstruction Quantization for Rare-Word Robust Automatic Speech Recognition

    May 27, 2026Xinyu Wang, Ziyu Zhao, Ke Bai +4Automatic Speech RecognitionPost-Training Quantization

  37. FalAR: A Large-scale Speaker-Annotated European Portuguese Speech Corpus of Parliamentary Sessions

    May 26, 2026Francisco Teixeira, Carlos Carvalho, Mariana Julião +7Automatic Speech RecognitionLow-Resource Speech Recognition

  38. Proactive for Uncertainty: Cause-Aware Error Diagnosis and Interactive Clarification for Spoken Dialogue Systems

    May 25, 2026Yizhou Peng, Ziyang Ma, Changsong Liu +3Spoken Dialogue SystemsAutomatic Speech Recognition

  39. Phonetic Modeling of Dialectal Variation in Vietnamese Speech

    May 23, 2026Quan Ngoc Hoang, Long Hoang Huu Nguyen, Nghia Hieu Nguyen +2Speech ProcessingAutomatic Speech Recognition

  40. End-to-End Intracortical Speech Decoding from Neural Activity

    May 23, 2026Owais Mujtaba Khanday, Jose A. Gonzalez-Lopez, Marc Ouellet +2Brain-Computer InterfacesNeural Decoding

  41. SCRIBE: Diagnostic Evaluation and Rich Transcription Models for Indic ASR

    May 20, 2026Kavya Manohar, Arghya Bhattacharya, Kush Juvekar +1ASR EvaluationAutomatic Speech Recognition

  42. FormalASR: End-to-End Spoken Chinese to Formal Text

    May 19, 2026Wanyi Ning, Yinshang Guo, Haitao Qian +3Speech ProcessingAutomatic Speech Recognition

  43. PAREDA: A Multi-Accent Speech Dataset of Natural Language Processing Research Discussions

    May 18, 2026Sicheng Jin, Dipankar Srirag, Aditya JoshiASR EvaluationSpeech Processing

  44. Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades

    May 17, 2026Donghyuk Jung, Youngwon ChoiAudio-Language Model EvaluationQuestion Answering

  45. JSPG: Dynamic Dictionary Filtering via Joint Semantic-Pinyin-Glyph Retrieval for Chinese Contextual ASR

    May 16, 2026Shilin Zhou, Zhenghua LiAutomatic Speech RecognitionSequence Alignment

  46. Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR

    May 14, 2026Ryo Magoshi, Takashi Maekaku, Yusuke ShinoharaDomain Adaptation for ASRDomain Adaptation

  47. Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs

    May 13, 2026Trung Nguyen Quang, Cheng Yi Lewis Won, Minh Duc Pham +3Code-Switching Speech RecognitionAudio-Language Models

  48. On the Interpretability of Whisper Encodings Using Sparse Autoencoders

    May 12, 2026Dan Pluth, Zachary Nicholas Houghton, Yu Zhou +1Transformer InterpretabilityMechanistic Interpretability

  49. Responsible Benchmarking of Fairness for Automatic Speech Recognition

    May 11, 2026Felix Herron, Ange Richard, François Portet +2Algorithmic FairnessDemographic Bias in ASR

  50. WorldSpeech: A Multilingual Speech Corpus from Around the World

    May 9, 2026Antonis Asonitis, Luca A. Lanzendörfer, Frédéric Berdoz +1Automatic Speech RecognitionLow-Resource Speech Recognition