Automatic Speech Recognition

Also known as ASR

Momentum

54 papers in the last four weeks, up 238% on the four weeks before. 0.5% of all new papers.

Jul 13Week of Sep 28

Latest papers 302

All topics
CardsList
  1. Earnings25: A Comprehensive 500-Hour Speech Benchmark for Finance

    Jul 26, 2026Denglin Jiang, Haoran Zhou, Anshul Wadhawan +7ASR EvaluationAutomatic Speech Recognition

  2. Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding

    Jul 24, 2026Pengfei Zhang, Biao Tian, Tianxin Xie +3Streaming ASRAutomatic Speech Recognition

  3. VibeVoice-ASR-BitNet Technical Report

    Jul 23, 2026Songchen Xu, Ting Song, Shaohan Huang +10Efficient Neural Network InferenceAutomatic Speech Recognition

  4. Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results

    Jul 21, 2026Ilse Huisman, Rares Popa, Yuanyuan Zhang +1ASR EvaluationAutomatic Speech Recognition

  5. Robust Assamese Speech Recognition through Controlled Fine-Tuning of Whisper Models

    Jul 19, 2026Ganapati Das, Dwipen Laskar, Hasin Afzal Ahmed +4Automatic Speech RecognitionLow-Resource Speech Recognition

  6. Natural Backdoor Attacks on Speech Recognition Models

    Jul 17, 2026Jinwen Xin, Xixiang Lyu, Jing MaBackdoor AttacksAutomatic Speech Recognition

  7. SpeechGuard: Online Defense against Backdoor Attacks on Speech Recognition Models

    Jul 17, 2026Jinwen Xin, Xixiang LvBackdoor DetectionAutomatic Speech Recognition

  8. Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model

    Jul 14, 2026Harsha Vardhan Khurdula, Abhinav Kumar Singh, Yoeven D Khemlani +1Automatic Speech RecognitionDiffusion Language Models

  9. An Omnilingual-ASR-Based Speech-LLM System for the 2nd MLC-SLM Challenge

    Jul 14, 2026Shuming Fang, Shuifei ZengASR EvaluationAutomatic Speech Recognition

  10. Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic Systems

    Jul 13, 2026Sheng Li, Jing Li, Felix Schijve +2RoboticsAutomatic Speech Recognition

  11. Unified Gradient Projection: Language-Balanced Continual Learning for Multilingual Low-Resource ASR

    Jul 13, 2026Ziang Ren, Guodong Lin, Yuchen Ai +2Automatic Speech RecognitionGradient Projection

  12. Tokenizer Transplantation: Mitigating Autoregressive Collapse in Edge-Efficient Bengali ASR

    Jul 10, 2026Sanjid Hasan, Md. Abdur RahmanAutomatic Speech RecognitionLow-Resource Speech Recognition

  13. Phone Segmentation and Recognition through Phonological Activation Mapping

    Jul 10, 2026Shikhar Bharadwaj, Kwanghee Choi, Stephen McIntosh +8Speech ProcessingAutomatic Speech Recognition

  14. Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition

    Jul 10, 2026Xugang Lu, Peng Shen, Yu Tsao +1Automatic Speech RecognitionAudio-Visual Speech Recognition

  15. When Synthetic Speech Is All You Have: Better Call GRPO

    Jul 9, 2026Shashi Kumar, Yanis Labrak, Hasindri Watawana +5Synthetic-to-Real Domain AdaptationDomain Adaptation for ASR

  16. On the Role of Conversational Timing in Synthetic Training Data for ASR

    Jul 9, 2026Máté Gedeon, Péter MihajlikAutomatic Speech RecognitionSynthetic Data Augmentation for Speech Recognition

  17. Diarization-Guided Qwen-ASR Adaptation for Multilingual Two-Speaker Conversational Speech

    Jul 9, 2026Hao Wu, RongQi Han, Zhen Wang +2Domain Adaptation for ASRAutomatic Speech Recognition

  18. VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness

    Jul 9, 2026Iulia-Maria Udrea, Alexandra Diaconu, Bogdan AlexeMultimodal RobustnessVisual Speaker Recognition

  19. Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs

    Jul 7, 2026Albert Zeyer, Ralf Schlüter, Hermann NeyGradient-Based AttributionSpeech Processing

  20. Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs

    Jul 7, 2026Ke-Han Lu, Keqi Deng, Ruchao Fan +2KV CachingAutomatic Speech Recognition

  21. Revisiting the Relation Between Language Model Perplexity and ASR Word Error Rate for Modern End-to-End Speech Recognition

    Jul 6, 2026Mohammad Zeineldeen, Albert Zeyer, Haoran Zhang +3ASR EvaluationAutomatic Speech Recognition

  22. REDDIT: Forgetting-Resistant Correction of Timestamp Drift in ASR via Replay-Based Distribution Editing

    Jul 6, 2026Cheng-Kang Chou, Ming-To Chuang, Ke-Han Lu +2ASR EvaluationSpeech Processing