Speech Processing

Latest papers 295

All topics
CardsList
  1. Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs

    Jul 7, 2026Albert Zeyer, Ralf Schlüter, Hermann NeyGradient-Based AttributionSpeech Processing

  2. Flow Matching-Based Speech Source Separation with Best-of-N Biometric Sampling

    Jul 7, 2026Anastasia Zorkina, Alexandr Anikin, Nikita Khmelev +5Flow MatchingSpeech Processing

  3. Listen to the Features: Voice Anonymization Driven by Content Embedding Matching over Signal Reconstruction

    Jul 7, 2026Adrien Schneider, Kacper Zabkowski, Anderson Augusma +3Speech ProcessingSpeaker Anonymization

  4. Fréchet Distance Loss on Speech Representations for Text-to-Speech Synthesis

    Jul 7, 2026Ho-Lam Chung, Kuan-Po Huang, Bo-Ru Lu +1Flow MatchingTTS Synthesis

  5. REDDIT: Forgetting-Resistant Correction of Timestamp Drift in ASR via Replay-Based Distribution Editing

    Jul 6, 2026Cheng-Kang Chou, Ming-To Chuang, Ke-Han Lu +2ASR EvaluationSpeech Processing

  6. DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language Modeling

    Jul 6, 2026Wataru Nakata, Yuki Saito, Hiroshi SaruwatariSpeech ProcessingLanguage Modeling

  7. Information-Geometric Superposed Vowel Evaluation: Part 1. Moraic Syllabary (Japanese)

    Jul 5, 2026Yusei Tamura, Shigekazu Ishihara, Ken ItoAudio Deepfake DetectionSpeech Processing

  8. S-DiverSe: Spanish Diverse Speech

    Jul 3, 2026Fernando López, Fernando Ibañez, Ana Martínez +4ASR EvaluationSpeech Processing

  9. Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities

    Jul 3, 2026Kaveri K. Sheth, Lawrence Borst, Tarek Kunze +6Speech Processing

  10. Using embeddings to predict spoken word duration and pitch in Mandarin monosyllabic words

    Jul 2, 2026Xiaoyun Jin, Mirjam Ernestus, R. Harald BaayenSpeech ProcessingSpeech Prosody

  11. RT-Tango: Real-Time Distributed Binaural Speech Enhancement for Low-Power Hearing Aid Devices

    Jul 2, 2026Z. Benslimane, P. Chouteau, M. Poreba +4Speech ProcessingSpeech Enhancement

  12. Speech Playground: An Interactive Tool for Speech Analysis and Comparison

    Jul 1, 2026Stephen McIntosh, Daisuke Saito, Nobuaki MinematsuSpeech Processing

  13. LuxEmo: Expressive Text-to-Speech Corpus for Luxembourgish

    Jun 30, 2026Nina Hosseini-Kivanani, Sandipana DowerahSpeech ProcessingLow-Resource TTS Synthesis

  14. How Bilingual Are SSL Speech Models? Cross-Lingual Probing of Articulatory Encoding with Finnish and Russian EMA

    Jun 30, 2026Ailín Pollio San Pedro, Tomi Kinnunen, Alexandre Nikolaev +1Speech ProcessingSelf-Supervised Speech Representation Learning

  15. FlexiSLM: A Spoken Language Model with Dynamic and Controllable Frame Rates

    Jun 30, 2026Jiaqi Li, Chaoren Wang, Xiaohai Tian +9Speech ProcessingSpeech Language Models

  16. UniSAE: Unified Speech Attribute Editing on Speaker, Emotion and Low-Level Content via Discrete Phonetic Posteriorgram Modelling

    Jun 30, 2026Chuanbo Zhu, Wuyou Zhou, Rongxiu Zhong +4Audio EditingSpeech Editing

  17. Child-Centric Voice Anonymization in Single and Multi-Speaker Speech via Domain-Adapted SSL Models

    Jun 29, 2026Pranav Tushar, Xiao Xiao Miao, Rong TongDomain AdaptationSpeech Processing

  18. TF-MoE: Time-Frequency Mixture-of-Experts for Efficient Speech Separation

    Jun 28, 2026Qinzhe Hu, Chenda Li, Wangyou Zhang +3Sparse Mixture-of-ExpertsSpeech Processing

  19. Position-Aware Target Speaker Extraction for Long-Form Multi-Party Conversations: A Diarization-Free Framework for ASR

    Jun 28, 2026Yichi Wang, Junzhe Chen, Wangjin Zhou +1Target Speaker ExtractionSpeech Processing

  20. AMR: Adaptive Modality Routing for Multimodal Polyglot Speaker Identification

    Jun 28, 2026Chuxiao Zuo, Yao Zhu, Minqiang Xu +3Multimodal RobustnessSpeech Processing

  21. wav2VOT: Automatic estimation of voice onset time, closure duration, and burst realisation with wav2vec2

    Jun 27, 2026James Tanner, Morgan Sonderegger, Jane Stuart-Smith +2Speech Foundation ModelsSpeech Processing

  22. wav2tok 2.0: Scalable Audio Tokenization Maintaining Explicit Pairwise Token Alignment for Efficient Audio Retrieval

    Jun 25, 2026Adhiraj Banerjee, Vipul AroraAudio Representation LearningSpeech Processing

  23. FBK's Long-form SpeechLLMs for IWSLT 2026 Instruction Following

    Jun 25, 2026Zhihang Xie, Marco Gaido, Sara Papi +2Audio-Language Model EvaluationSpeech Processing

  24. SE-AGCNet: An End-to-End Framework for Joint Speech Enhancement and Loudness Control in Meeting Scenarios

    Jun 24, 2026Jinming Zhang, Wei Rao, Xionghu Zhong +1Speech ProcessingSpeech Enhancement

  25. Phoneme-Level Mispronunciation Screening in Polish-Speaking Children with an Explainable Assistant

    Jun 23, 2026Milosz Dudek, Daria Hemmerling, Kamil Kwarciak +9Speech ProcessingAutomatic Speech Recognition

  26. What Does a Pathological Speech Assessment Model Know about Acoustic Features? A Case Study on Oral and Oropharyngeal Cancer Patients

    Jun 23, 2026Tuan Nguyen, Corinne Fredouille, Alain Ghio +2Speech Quality AssessmentInterpretable ML

  27. NeuroSonic: Conditional Flow Matching for EEG-to-Speech Reconstruction

    Jun 23, 2026Wenhao Gao, Yifan Wang, Yijia Ma +3Conditional Flow MatchingEEG Decoding

  28. A Fusion-Aware Two-Stage Framework for Mispronunciation Detection and Diagnosis in Low-Resource Modern Standard Arabic

    Jun 23, 2026Jing Yang, Shuqing Zhang, Yongyi Deng +5Domain AdaptationSpeech Processing

  29. VieSpeaker: A Large-Scale Vietnamese Speaker Recognition Dataset Beyond Visual Dependency

    Jun 23, 2026Viet Hoang Pham, Tran Trung Nguyen, Bao Thu Ho +2Speech ProcessingLow-Resource Language Processing