Speech Processing

Latest papers 295

All topics
CardsList
  1. A Large-Scale Per-Speaker Analysis of Re-identification Risk in Speech Anonymization

    Jun 5, 2026Orane Dufour, Paul Magron, Mickael Rouvier +1Privacy AuditingSpeech Processing

  2. Phonetic Error Analysis of Raw Waveform Acoustic Models

    Jun 5, 2026Erfan Loweimi, Zhengjun Yue, Andrea Carmantini +3ASR EvaluationSpeech Processing

  3. Multilingual Multi-Speaker Unit Vocoders: A Systematic Analysis of Discrete Speech Representations

    Jun 4, 2026Naman Kothari, Arjun Gangwar, Adarsh Arigala +1TTS SynthesisSpeech Processing

  4. Revisiting Lexicon Evaluation in Unsupervised Word Discovery

    Jun 4, 2026Simon Malan, Danel Slabbert, Herman KamperUnsupervised ClusteringSpeech Processing

  5. SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech

    Jun 4, 2026Virginia Ceccatelli, Yejin Jeon, David Ifeoluwa AdelaniAudio-Language Model EvaluationLanguage Model Safety Evaluation

  6. Do speech foundation models perceive speaker similarity as humans do?

    Jun 4, 2026Minoru Kishi, Hayato Yagi, Shinnosuke Takamichi +1Audio Representation LearningSpeech Foundation Models

  7. Domain-Aware Mispronunciation Detection and Diagnosis Using Language-Specific Statistical Graphs

    Jun 4, 2026Huu Tuong Tu, Hanh Nguyen, Thien Van Luong +3Speech Processing

  8. Multilingual Detection of Alzheimer's Disease from Speech: A Cross-Linguistic Transfer Learning Approach

    Jun 4, 2026Nadine Yasser Abdelhalim, Emmanuel Akinrintoyo, Nicole SalomonsSpeech-Based Dementia DetectionSpeech Processing

  9. CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding

    Jun 3, 2026Eugene Kwek, Feng Liu, Rui Zhang +1Audio Token CompressionAudio Representation Learning

  10. Feasibility of Time-Domain DNN-Based Speech Enhancement on Embedded FPGA for Hearing Aid

    Jun 2, 2026Feyisayo Olalere, Umut Altin, Kiki van der Heijden +1Efficient Neural Network InferenceSpeech Processing

  11. Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning

    Jun 1, 2026Ding Ma, Jinyi Mi, Fengji Li +5Representation LearningSpeech Processing

  12. SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing

    Jun 1, 2026Hanlin Zhang, Daxin Tan, Dehua Tao +3Audio-Language Model EvaluationAudio Editing

  13. Context-aware child-directed speech detection from long-form recordings

    May 31, 2026Théo Charlot, Tarek Kunze, Kaveri K. Sheth +2Speech ProcessingAudio Understanding

  14. MelT: A Portable, Single-GEMM Mel Audio Frontend via Non-Uniform DFT with Measured Latency and Energy Gains on GPUs

    May 31, 2026Augusto Camargo, Marcelo FingerGPU AccelerationSpeech Processing

  15. Local Diagnostics of Continuous Normalizing Flow for Out-of-Distribution Detection

    May 30, 2026Xinwei Cao, Mengxuan Lu, Torbjørn Svendsen +1Speech ProcessingDistribution Shift Detection

  16. Extracting accent features in spoken Brazilian Portuguese without sociolinguistic labels

    May 28, 2026Pedro H. L. Leite, Pedro Benevenuto Valadares, Luiz W. P. BiscainhoAudio Representation LearningSpeech Processing

  17. HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding

    May 28, 2026Bohan Li, Shi Lian, Hankun Wang +6Audio Representation LearningSpeech Foundation Models

  18. ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood

    May 28, 2026Tiantian Feng, Anfeng Xu, Xuan Shi +10Audio-Language Model EvaluationSpeech Quality Assessment

  19. Bandwidth-Efficient and Privacy-Preserving Edge-Cloud Many-to-Many Speech Translation

    May 27, 2026Yexing Du, Kaiyuan Liu, Youcheng Pan +4Speech TranslationSpeech Processing

  20. Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox

    May 26, 2026Jiacheng Pang, Ashutosh Chaubey, Mohammad SoleymaniAudio-Language Model EvaluationSpeech Processing

  21. Beyond Binary: Speech Representations Across the Cognitive Score Hierarchy

    May 26, 2026Serli Kopar, Roshan Prakash Rane, Christian Mychajliw +6Speech ProcessingAudio Understanding

  22. A Dataset of Robot-Patient and Doctor-Patient Medical Dialogues for Spoken Language Processing Tasks

    May 26, 2026Heriberto Cuayahuitl, Grace JangHealthcareSpeech Processing

  23. Multilingual Phonological Feature Recognition with Self-Supervised Speech Models

    May 25, 2026Abner Hernandez, Tomás Arias-Vergara, Daiqi Liu +2Speech ProcessingCross-Lingual Transfer

  24. A Multimodal Framework for Dementia Detection via Linguistic and Acoustic Representation Learning

    May 25, 2026Loukas Ilias, Dimitris AskounisSpeech-Based Dementia DetectionSpeech Processing

  25. Zero-Shot Parkinson's Disease Detection from Speech: Comparing Large Audio and Language Models

    May 24, 2026Muhammad Ashad Kabir, Sirajam MuniraAudio-Language Model EvaluationZero-Shot Learning

  26. Phonetic Modeling of Dialectal Variation in Vietnamese Speech

    May 23, 2026Quan Ngoc Hoang, Long Hoang Huu Nguyen, Nghia Hieu Nguyen +2Speech ProcessingAutomatic Speech Recognition

  27. Convex Low-resource Accent-Robust Language Detection in Speech Recognition

    May 22, 2026Miria Feng, William Tan, Mert PilanciDistribution Shift RobustnessSpeech Processing