Automatic Speech Recognition

Latest papers 207

All topics
CardsList
  1. When Capabilities Fail to Compose: Diagnosing the Compositionality Gap in Large Audio-Language Models

    Sep 29, 2026Chien-Feng Liu, Chih-Kai Yang, Bo-Han Feng +3Large Audio Language ModelsLarge Language Models Fail

  2. Benchmarking Automatic Speech Recognition Tools for Iberian Languages

    Sep 29, 2026Fernando López, Pablo Gómez, David Solans +2Automatic Speech Recognition EvaluationMultilingual Automatic Speech Recognition

  3. BaLEEN: Biasing with Latent Encoded Entities for Context-Aware ASR

    Sep 29, 2026Chihiro Taguchi, Yotaro Kubo, Rujikorn CharakornAutomatic Speech RecognitionKeyword Spotting

  4. Stealth Is a Relation, Not a Property: How Event Representations Create Blind Spots for Timing Attacks in Event-Based Perception

    Sep 28, 2026Shoaib Ahmed Dipu, Md. Shaown Miah, Kamrul Hasan +1Attack StealthinessVideo Surveillance

  5. CoSE-E: A Benchmark for Code-switched Speech Evaluation in Enterprise Settings

    Sep 28, 2026Shama Gupta, Hoang H Nguyen, Chelsea Huang +2Code-SwitchingAutomatic Speech Recognition Evaluation

  6. RISE: Red-teaming via Iterative Strategy Evolution for Modern Text-to-Image Models

    Sep 28, 2026Dmitrii Kharlapenko, Sergei Bratchikov, Konstantin Korolev +1Modern Text-To-Image ModelsViolation

  7. CARDAMOM: A Micro-Dialectal Arabic Speech Dataset for ASR

    Sep 28, 2026Bashar Talafha, Samar M. Magdy, Aisha Alansari +36DialectsMultilingual Automatic Speech Recognition

  8. Evaluating Machine Unlearning in ASR

    Sep 28, 2026Diogo Dinis, Francisco Teixeira, Bhiksha Raj +2Machine UnlearningAutomatic Speech Recognition

  9. Unified Target-Speaker ASR with Text and Enrollment Speech Cues

    Sep 27, 2026Yuxiang Mei, Yuchen Yan, Dongxing Xu +2Target Speaker ExtractionSpeaker

  10. Pretrained ASR Pseudo-labeling for Noisy Police Audio

    Sep 24, 2026Kaavya Chaparala, Su Huang, Stephen L. Morgan +2High Confidence Pseudo-LabelsAutomatic Speech Recognition

  11. A Training Criterion with Token-Level Tolerance to Transcription Ambiguity for Automatic Speech Recognition

    Sep 24, 2026Saurabh Kumar, Diptiman Mohanta, Prasanta Kumar GhoshAutomatic Speech RecognitionTranscription

  12. STAM-ASR: Speaker-Temporal Anchoring with Memory for Multi-Speaker ASR

    Sep 24, 2026Victor Tolulope Olufemi, Syeda Faiza Ahmed Sara, Shammur Absar ChowdhuryAutomatic Speech RecognitionSpeaker

  13. Benchmarking and Domain Adaptation of Automatic Speech Recognition (ASR) for Adolescent Health Communication in Ghanaian Languages

    Sep 24, 2026Stephen E. Moore, Akwasi Asare, Mich-Seth Owusu +3Automatic Speech RecognitionDomain Adaptation

  14. Joint Analysis of Latent Dimensionality and Frame Rate in Continuous Audio Encoders

    Sep 24, 2026Kyudan Jung, Sehyun Lee, Son-ha Jo +2OpencodeFrame Rate

  15. TS-OPD: Reconciling ASR and QA in Speech Language Models via Task-Specific On-Policy Distillation

    Sep 24, 2026Yujie Guo, Hongjie Chen, Jian Kang +3Speech Language ModelsAutomatic Speech Recognition

  16. agentic-ger: terminology recovery in long-form speech using global context

    Sep 24, 2026Yanqiao Zhu, Wupeng Wang, Zhifu Gao +2Speech Language ModelsAutomatic Speech Recognition

  17. Learning New Words from Unlabeled Test Data in Automatic Speech Recognition

    Sep 24, 2026Mengqi Wang, Mark A. Hasegawa-Johnson, Haolong Zheng +1Automatic Speech RecognitionAccents

  18. ASR ensembling for phoneme intelligibility evaluation of speech anonymizers

    Sep 23, 2026Victor Ménestrel, Sebastian Möller, Slim Ouni +1Automatic Speech Recognition EvaluationEnd-To-End Automatic Speech Recognition Models

  19. Vimarsha: Faithful ASR Evaluation for Indian Languages with Demographic Diversity, In-the-Wild Audio and Spelling Variations

    Sep 21, 2026Kaushal Santosh Bhogale, Srija Anand, Sadakopa Ramakrishnan Thothathiri +3Automatic Speech Recognition EvaluationIndian Languages

  20. Long-Tail Rebalancing for Non-Verbal Vocalization-Aware ASR: A Track 1 System for the NVVSpeech Challenge

    Sep 20, 2026Shangyue Jia, Jingru Ma, Yangzhuo Li +9Automatic Speech RecognitionNonverbal Cues

  21. HearInContext: A Benchmark for Implicit Context in Speech Recognition

    Sep 16, 2026Yifan Gao, Yao Tian, Hongbin SuoAutomatic Speech Recognition

  22. Sequential Adapter Stacking for Cross-Lingual Low-Resource ASR

    Sep 14, 2026Thai Thi Thanh Thao Dang, Mengjie Qian, Kate KnillMultilingual Automatic Speech RecognitionAutomatic Speech Recognition

  23. Merging the Knowledge of LLMs for Automatic Speech Recognition

    Sep 14, 2026Hayato Futami, Tatsuya KawaharaEnd-To-End Automatic Speech Recognition ModelsAutomatic Speech Recognition

  24. Typhoon ASR Streaming: Steerable Low-Latency Thai Speech Recognition with Real-Time Shallow Fusion

    Sep 14, 2026Warit Sirichotedumrong, Tanawin Samutsin, Shah Faisal Wani +2Automatic Speech RecognitionDecoding

  25. Xiaomi-CocktailASR-1 Technical Report

    Sep 11, 2026Yiru Zhang, Hang Su, Lichun Fan +10Automatic Speech RecognitionReport

  26. Quantifying Consonant Contributions to Word Intelligibility via Acoustic Masking

    Sep 10, 2026Eunjung Yeo, Kwanghee Choi, Krupaben Kothadia +4ConsonantsDysarthric Speech

  27. AgentHijack: Visual Patch Attacks on Multimodal Computer-Use Agents

    Sep 10, 2026Zhihao Liu, Hongyu Sun, Zhiyuan Fu +7Computer-Use AgentsInstruction Injection Attacks

  28. Do speech foundation models really learn words?

    Sep 9, 2026Robin Huo, Ewan DunbarSelf-Supervised Speech ModelsWav2Vec

  29. Pushing the Boundaries of Streaming Multi-Speaker ASR: A Systematic Study of Architectural Trade-offs

    Sep 9, 2026Taejin Park, Ivan Medennikov, Kunal Dhawan +3Automatic Speech RecognitionStreaming

  30. Orukeet: Multilingual ASR with Frozen Gabor Kernels

    Sep 9, 2026Nathan Roll, Irene Yi, Büşra Marşan +6Multilingual Automatic Speech RecognitionAutomatic Speech Recognition

  31. Source-Adaptive Data Curation for Bilingual NVV-Aware ASR

    Sep 9, 2026Yuang Cao, Qirui Zhan, Jingbin Hu +7Automatic Speech RecognitionMandarin

  32. StreamAlign: Streaming Text-Aligned Speech Tokenization

    Sep 9, 2026Kang-wook Kim, Jinyoung Park, Jinsoo Kim +3Automatic Speech RecognitionStreaming

  33. Qwen-Audio-3.0-ASR Technical Report

    Sep 7, 2026Chuanmeng Bian, Daren Chen, Peixin Chen +42Automatic Speech RecognitionTranscription

  34. Soft Posterior Speaker Injection for Multi-Talker Speech Recognition

    Sep 1, 2026Jian Zhu, Jun Sun, Jiang Yang +6Automatic Speech Recognition

  35. TRIS: A Tri-Layer Retrieval Integrity Sieve Against Knowledge Poisoning

    Aug 31, 2026Muhaimin Bin Munir, Akib Jawad Ononto, Nazia Shehnaz Joynab +2Agentic Retrieval-Augmented Generation SystemsPoisoning

  36. Linguistic Distance Segregates Latent Representations in Automatic Speech Recognition Systems

    Aug 31, 2026Ting-Hui Cheng, Line Katrine Harder Clemmensen, Sneha DasAutomatic Speech RecognitionLanguage Acquisition

  37. Parallel Time-Band Mixing with Learned Observation-Adding for Robust ASR Front-Ends

    Aug 31, 2026Xingyu Shen, Runze Wang, Wei-Ping Zhu +1Speech EnhancementAutomatic Speech Recognition

  38. Phoneme-guided TTS augmentation for ASR: A unified pipeline and multilingual evaluation

    Aug 27, 2026Zhen Wang, TianRui Wu, RongQi Han +3Automatic Speech RecognitionLuxembourgish

  39. Easper: An Accessible ASR Pipeline for Language Documentation

    Aug 12, 2026Aso Mahmudi, Ting Dang, Ekaterina Vylomova +1TranscriptionAutomatic Speech Recognition

  40. Seeds Before Objectives: Rethinking Evaluation for Low-Resource Garhwali ASR

    Aug 11, 2026Karamvir Singh Batra, Prathamjyot Singh, Ashima Sood +2Automatic Speech Recognition EvaluationLow-Resource Languages

  41. Edge Phoneme Recognition for Children's Speech through Age-Aware Training

    Aug 10, 2026Matthew Arboleda, Ryan Arboleda, Sophie Haak +6Grapheme-To-PhonemeAutomatic Speech Recognition

  42. Decolonizing Linguistic Policies in Automated Speech Recognition: A Framework for Cross-Culturally Competent Speech AI

    Aug 6, 2026Jay L. Cunningham, Mark Atta Mensah, Richard Martinez +2Automatic Speech RecognitionLinguistics

  43. How to Recognize New Words: A Comparison Between Context Biasing Methods and Speech LLMs

    Aug 6, 2026Christian Huber, Alexander WaibelAutomatic Speech RecognitionBiases

  44. Analyzing Speech Condition Effects in Dysarthric ASR: A Layer-wise Probing Study

    Aug 3, 2026Darwin Jelestin Muthu, Navya Gupta, Wei Lin Tay +3Dysarthric SpeechAutomatic Speech Recognition

  45. Latent Softmax for Data-Efficient Phoneme-Based Multilingual ASR Across Tonal and Non-Tonal Languages

    Aug 2, 2026Saierdaer Yusuyin, Nanling Jiang, Hao Huang +1Multilingual Automatic Speech RecognitionGrapheme-To-Phoneme

  46. Normal-Anchored First-Order Model-Agnostic Meta-Learning based Whisper Fine-Tuning for Enhancing Fairness of Cleft Lip and Palate Speech Recognition

    Jul 31, 2026Susmita Bhattacharjee, Jagabandhu Mishra, H. S. Shekhawat +2Whisper-Large-V3Automatic Speech Recognition

  47. AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach

    Jul 30, 2026Zixuan Jiang, Binghao Qiang, Jiaying Chi +3Automatic Speech RecognitionTranscript

  48. SpeechLLM Meets Federated Learning for End-to-End ASR: English and Italian Case Studies

    Jul 28, 2026Mohamed Nabih Ali, Daniele Falavigna, Alessio BruttiSpeech Language ModelsSpeech Encoder

  49. Earnings25: A Comprehensive 500-Hour Speech Benchmark for Finance

    Jul 26, 2026Denglin Jiang, Haoran Zhou, Anshul Wadhawan +7Automatic Speech Recognition EvaluationFinance Benchmarks