Speech Processing

Latest papers 295

All topics
CardsList
  1. VieSpeaker: A Large-Scale Vietnamese Speaker Recognition Dataset Beyond Visual Dependency

    Jun 23, 2026Viet Hoang Pham, Tran Trung Nguyen, Bao Thu Ho +2Speech ProcessingLow-Resource Language Processing

  2. EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis

    Jun 22, 2026Wai Laam Mak, Isibor Kennedy Ihianle, Pedro MachadoSpeech ProcessingEmotion Recognition in Conversations

  3. On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models

    Jun 22, 2026Shunsuke Kando, Wataru Nakata, Shinnosuke Takamichi +1Speech ProcessingSpeech Language Models

  4. Cross-lingual Retrieval-Augmented Classification for Dysarthria Severity Assessment

    Jun 22, 2026Taeyoung Jeong, Insung Lee, Du-Seong Chang +1Retrieval-Augmented ClassificationSpeech Quality Assessment

  5. Kiwano: A Cutting-Edge Open-Source Toolkit for Speaker Verification

    Jun 21, 2026Mickael Rouvier, Pierre Michel BousquetSpeaker VerificationSpeech Processing

  6. Physics-Informed Neural Operator for Speech Production Analysis

    Jun 21, 2026Kazuya Yokota, Xinmeng Luan, Debasish Ray Mohapatra +2Speech ProcessingPDE Operator Learning

  7. DSSCNet: A Transfer Learning Framework for Cross-Corpus Dysarthric Speech Severity Classification

    Jun 20, 2026Arnab Kumar Roy, Hemant Kumar Kathania, Paban Sapkota +2Speech ProcessingTransfer Learning

  8. How Well Do Self-Supervised Speech Models Encode Age and Gender in Children's Speech? A Layer-Wise Analysis Across Multiple Architectures

    Jun 20, 2026Abhijit Sinha, Hemant Kumar Kathania, Mohit Joshi +3Speech ProcessingSelf-Supervised Speech Representation Learning

  9. Using Phonological-Level Wav2Vec2 for Mandarin Automatic Mispronunciation Detection and Diagnosis

    Jun 20, 2026Jinghao Chen, Mostafa Shahin, Beena AhmedSpeech Processing

  10. Toward Open-Set Speaker Attribute Prediction with Keyword-Appended LLM Embeddings

    Jun 20, 2026Byoungjun So, Jaejun Lee, Kyogu LeeAudio Representation LearningSpeech Processing

  11. ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era

    Jun 20, 2026Masao Someki, Alexander Polok, Carlos Carvalho +14Speech Processing

  12. An Evaluation Framework for Text-to-Speech Voice Reconstruction

    Jun 19, 2026Ariadna Sanchez, Christoph Minixhofer, Korin Richmond +3Speech Generation EvaluationTTS Evaluation

  13. Synthetic Audio Generation Framework for Air Traffic Control Speech Recognition

    Jun 19, 2026Raphaël Bagat, Zhe Zhang, Junichi Yamagishi +2Synthetic Data GenerationSpeech Processing

  14. Speaker Identity in Non-Verbal Vocalizations: Conditional Distillation and Mixture of Experts Approach

    Jun 19, 2026Tzu-Chieh Wei, Yi-Cheng Lin, Huang-Cheng Chou +4Speaker VerificationDomain Adaptation for ASR

  15. Zero-VC: Zero-Lookahead Streaming Voice Conversion via Speaker Anonymization

    Jun 18, 2026Yudong Li, Zihao Fang, Junwen Qiu +4Speech ProcessingSpeaker Anonymization

  16. Light-weight Pronunciation Assessment via Discrete Speech Token Surprisal

    Jun 18, 2026Syeda Faiza Ahmed Sara, Shammur Absar ChowdhurySpeech ProcessingDiscrete Speech Representation Learning

  17. Cross-Dataset, Age, and Gender Generalization: A Comprehensive Analysis of Fine-Tuning Strategies for Low-Resource Children's ASR

    Jun 18, 2026Abhijit Sinha, Hemant Kumar Kathania, Sudarsana Reddy Kadiri +1Speech ProcessingAutomatic Speech Recognition

  18. Adaptive Speech-to-Spike Encoding for Spiking Neural Networks

    Jun 17, 2026Taharim Rahman Anon, Jakaria Islam EmonKeyword SpottingSpeech Processing

  19. Augmenting Dysarthric Speech Severity Assessment with MOS Supervision

    Jun 17, 2026Kaimeng Jia, Minzhu Tu, Zengrui Jin +2Speech Quality AssessmentSpeech Processing

  20. Fair Cognitive Impairment Detection Through Unlearning

    Jun 17, 2026William Nguyen, Jiali Cheng, Hadi AmiriAdversarial Representation LearningAlgorithmic Fairness

  21. Montreal Forced Aligner and the state of speech-to-text alignment in 2026

    Jun 16, 2026Michael McAuliffe, Kaylynn Gunter, Michael Wagner +1Speech ProcessingCross-Lingual Transfer

  22. Next-Turn: Duration-Aware Streaming Endpoint Detection via Time-to-Next-Speech-Onset Prediction

    Jun 16, 2026Tristan Tsoi, Jiajun Deng, Yingke Zhu +5Event Time PredictionStreaming ASR

  23. A Generalized Formalism of Auto-Regressive Decoding for Speech Processing

    Jun 16, 2026Julia Gachot, Philipp Allgeuer, Marie S. Bauer +1Speech ProcessingAutoregressive Decoding

  24. SpeechDx: A Multi-Task Benchmark for Clinical Speech AI

    Jun 15, 2026Sejal Bhalla, Larry Kieu, Aina Merchant +2Speech ProcessingSelf-Supervised Speech Representation Learning

  25. Intelligibility of Speech in Noise: Investigating Contribution of Magnitude and Phase Spectra

    Jun 15, 2026Bhanu Teja Nellore, Sudarsana Reddy Kadiri, Rohit Kumar +2Speech ProcessingNoise Robustness

  26. ArtNet: A JEPA-Like Articulatory Predictive Framework for Robust Zero-Shot Phoneme Recognition

    Jun 15, 2026Zeqian Hu, Fuliang Weng, Shu Shang +1Zero-Shot LearningJoint-Embedding Predictive Architecture

  27. Confidence Score Guided Incremental and Speaker Adaptive Pseudo-Labeling for Semi-Supervised Elderly Speech Recognition

    Jun 15, 2026Chengxi Deng, Xurong Xie, Shujie Hu +7Speech ProcessingAutomatic Speech Recognition