Speech Processing

Latest papers 295

All topics
CardsList
  1. Decoding while Adapting: Zero-Shot Online Speaker Adaptation via Audio-Textual Prompts for Elderly Speech Recognition

    Jun 15, 2026Chengxi Deng, Xurong Xie, Shujie Hu +7Speech ProcessingAutomatic Speech Recognition

  2. TMASC: Transmasculine Attitude and Speech Corpus

    Jun 15, 2026Sidney WongSpeech Processing

  3. ArtBoost: Synthetic Articulatory Data Augmentation for Acoustic-to-Articulatory Inversion

    Jun 15, 2026Hyung Kyu Kim, Byungchan Hwang, Hak Gu KimSynthetic Data AugmentationData Augmentation

  4. Stabilizing Short Duration Speaker Verification through Neural Re-scoring with Hybrid Enrollment

    Jun 15, 2026Zhiqi Ai, Han Cheng, Shiyi Mu +3Speaker VerificationSpeech Processing

  5. Scaling Human and G2P Supervision for Robust Phonetic Transcription

    Jun 14, 2026Alexander Metzger, Aruna Srivastava, Ruslan MukhamedvaleevSpeech ProcessingAutomatic Speech Recognition

  6. MambAdapter: Lightweight Mamba-Based Adapters for Parameter-Efficient Transfer Learning in Speech and Audio

    Jun 14, 2026Salman Hussain Ali, Umberto Cappellazzo, Mirco RavanelliMambaSpeech Processing

  7. AP-GRPO: Anchor-Gated Phonetic Alignment with Policy Optimization for Pathological Speech Reconstruction

    Jun 14, 2026Pengfei Zhang, Hoang H Nguyen, Yutong Song +6RL for Language ModelsSpeech Processing

  8. Prior over Evidence: Stereotype-Driven Diagnosis in LLM-Based L2 Pronunciation Feedback

    Jun 13, 2026Rong Wang, Kun SunAudio-Language Model EvaluationLLM Grounding

  9. Learning to Hear Hesitation: Continual Learning for Disfluency-Aware ASR

    Jun 12, 2026Henri-Leon Kordt, Theresa Pekarek Rosin, Jae Hee Lee +1Speech ProcessingAutomatic Speech Recognition

  10. MaskedFOP: Polyglot Speaker Identification under Missing Visual Modality via Cascaded Graph Label Propagation

    Jun 12, 2026Ayoub Elkhouzari, Youssef Iraqi, Loubna MekouarMissing-Modality LearningSpeech Processing

  11. Predicting Cognitive Load from Speech and Interaction Dynamics in Dyadic Conversations

    Jun 11, 2026Tahiya ChowdhurySpeech Processing

  12. Towards Data-free and Training-free Compression for Speech Foundation Models Using Parameter Clustering

    Jun 10, 2026Haoning Xu, Zhaoqing Li, Huimeng Wang +4Speech Foundation ModelsClustering

  13. Fast Speech Foundation Model Distillation Using Interleaved Stacking

    Jun 10, 2026Eungbeom Kim, Kyogu LeeSpeech Foundation ModelsSpeech Processing

  14. Benchmarking Neural Speech Compression from a Rate-Distortion Perspective

    Jun 10, 2026Jun Xu, Zhengxue Cheng, Fengxi Zhang +3Neural Audio CodecsSpeech Processing

  15. SARA: A Dual-Stream VAE for High-Fidelity Speech Generation via Integrating Semantic and Acoustic Representations

    Jun 10, 2026Peijie Chen, Wenhao Guan, Weijie Wu +7Variational AutoencodersAudio Representation Learning

  16. CS-YODAS: A Mined Dataset of In-the-Wild Code-Switched Speech

    Jun 9, 2026Brian Yan, Qingzheng Wang, Matthew Wiesner +9Code-SwitchingSpeech Processing

  17. ContextCodec: Content-Focused Context Guidance for Ultra-Low Bitrate Speech Coding

    Jun 9, 2026Chengbin Liang, Wenqi Guo, Hao Cao +1Neural Audio CodecsSpeech Processing

  18. ViP-VL: Vietnamese Self-supervised Speech Pretraining Model with Vector-Quantization Learning

    Jun 9, 2026Khanh Le, Kiet Anh Hoang, Bao Nguyen +5Audio Representation LearningSpeech Processing

  19. Automated Pronunciation Evaluation for Korean Toddler Speech using Speech Diarization and Self-Supervised Learning

    Jun 8, 2026Diane Myung-kyung Woodbridge, Jee Hyun SuhSpeech ProcessingSelf-Supervised Speech Representation Learning

  20. MeCo: One-Step MeanFlow-based Corrector for Multi-Channel Speech Separation

    Jun 8, 2026Dohwan Kim, Jung-Woo ChoiFlow MatchingMeanFlow

  21. A Finetuned SpeechLLM for Joint Multi-Granular L2 Assessment and Natural-Language Rationales

    Jun 8, 2026Aditya Kamlesh Parikh, Cristian Tejedor-Garcia, Catia Cucchiarini +1Audio-Language Model EvaluationSpeech Processing

  22. Multi-View Speech Representation Learning for Parkinson's Disease Detection Using Context-guided Cross-modal Attention

    Jun 8, 2026George Theodosiou, Loukas Ilias, Dimitris AskounisAudio Representation LearningSpeech Processing

  23. End-to-End Training for Discrete Token LLM based TTS System

    Jun 8, 2026Changfeng Gao, Yong Ren, Jun Yuan +3TTS SynthesisSpeech Processing

  24. MeanVC 2: Robust Low-Latency Streaming Zero-Shot Voice Conversion

    Jun 8, 2026Guobin Ma, Yuxuan Xia, Yuepeng Jiang +6Diffusion TransformerAudio Diffusion Models

  25. From A to B to A: Palindromic Zero-Shot Voice Conversion with Non-Parallel Data

    Jun 7, 2026Moshe Mandel, Shlomo E. ChazanSpeech ProcessingVoice Conversion

  26. TRADE: Transducer-Augmented Decoder for Speech LLM

    Jun 7, 2026Yun Tang, Shanil Puri, Shinji Watanabe +1Streaming ASRSpeech Processing

  27. Paediatric-HGNN: A Hybrid Heterogeneous Graph Neural Network for Detecting Disfluency in Children's Speech via Multiscale Acoustic Fusion

    Jun 6, 2026Rashini Liyanarachchi, Rachael Mackay, Alison Short +2Heterogeneous GNNsSpeech Processing