Speech Processing

Latest papers 295

All topics
CardsList
  1. Beyond Residual Connections: Manifold-Constrained Hyper-Connections for Robust Speaker Representation Learning

    Aug 6, 2026Zezhong Jin, Xiaoyu Wang, Zhe Li +4Audio Representation LearningResidual Learning

  2. Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing

    Aug 5, 2026Iftach Shoham, Tali Dror, Oren Gal +3Speech EditingAudio Diffusion Models

  3. MERaLiON-GR: Speech Gender Recognition Model for English and SEA Languages

    Aug 5, 2026Qiongqiong Wang, Ai Ti Aw, Nancy F. Chen +18Speech Foundation ModelsSpeech Processing

  4. Analyzing Speech Condition Effects in Dysarthric ASR: A Layer-wise Probing Study

    Aug 3, 2026Darwin Jelestin Muthu, Navya Gupta, Wei Lin Tay +3Speech ProcessingLow-Resource Speech Recognition

  5. dots.tts.edit: Precisely Controlled Speech Editing with a Continuous Autoregressive Model

    Aug 2, 2026Hankun Wang, Bohan Li, Shi Lian +7Speech Foundation ModelsSpeech Editing

  6. AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach

    Jul 30, 2026Zixuan Jiang, Binghao Qiang, Jiaying Chi +3ASR EvaluationStreaming ASR

  7. Depression Markers in Speech: An Approach based on Tract Variables Dynamics

    Jul 28, 2026Sahar Altalhi, Tanaya Guha, Alessandro VinciarelliDepression DetectionSpeech Processing

  8. VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment

    Jul 28, 2026Stephen Bauer, Sheila Seidel, Shanza Iftikhar +2Model CompressionSpeech Processing

  9. Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages

    Jul 26, 2026Deovrat Mehendale, Aditya Mehndiratta, Dhruv Rathi +2ASR EvaluationSpeech Processing

  10. Speech Signals Complement LLMs for Predicting Interpersonal Attraction in Speed Dating

    Jul 25, 2026Yuriko Kikuchi, Takato Hayashi, Ryusei Kimura +3Speech ProcessingHuman Behavior Prediction

  11. Synthetic Speech, Real Signal: Paralinguistic Preservation and Cross-Lingual Augmentation via Voice Cloning

    Jul 24, 2026Roseline Polle, Owen Parsons, George Fairs +5Synthetic Data AugmentationSpeech Processing

  12. Improving the performance of an ASV system using hybrid speech features

    Jul 22, 2026Stanisław Ciszkiewicz, Artur JanickiSpeaker VerificationSpeech Processing

  13. What the Waveform Knows: Transparent-first Speech and Audio Intelligence with Caption Studio

    Jul 21, 2026Cheng Siong Chin, Jianhua Zhang, Mohan VenkateshkumarExplainable Artificial IntelligenceSpeech Processing

  14. ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions

    Jul 20, 2026Fernando López, Ana Ayala, Guillermo Segovia +4Audio-Language Model EvaluationSpoken Language Understanding

  15. Re-Sonance: A Dysarthric Asynchronous Real-Time Speech Conversion System Based on a Three-Stage Cascaded ASR-LLM-TTS Architecture

    Jul 20, 2026Yuxuan Wu, Yifan Xu, Junkun Wang +3Speech Processing

  16. SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings

    Jul 16, 2026Shuai Wang, Zihan Qian, Ke Zhang +9Target Speaker ExtractionSpeech Processing

  17. RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems

    Jul 16, 2026David Ayllon, Alice Baird, Jeffrey Brooks +11ASR EvaluationVoice Agent Evaluation

  18. Self-supervised Speech Comparison for L2 Phone, Rhythm, and Intonation Scoring

    Jul 15, 2026Stephen McIntosh, Reuben Smit, Daisuke Saito +2Dynamic Time WarpingSpeech Processing

  19. Learning Speaker Identity Beyond Language and Modality Constraints: Insights from the POLY-SIM 2026 Challenge

    Jul 15, 2026Marta Moscati, Muhammad Saad Saeed, Marina Zanoni +9Missing-Modality LearningMultimodal Robustness

  20. The SonicAGI System for the REAL-TSE Challenge

    Jul 13, 2026Kai Li, Wendi Sang, Jintao Cheng +1Target Speaker ExtractionSpeech Processing

  21. GigaAM Multilingual: Foundation Model for Underrepresented Languages

    Jul 11, 2026Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov +5Speech Foundation ModelsSpeech Processing

  22. Hybrid Continual Learning for Low-Resource Australian Aboriginal Language Identification

    Jul 11, 2026Pravina Mylvaganam, Ting Dang, Eliathamby Ambikairajah +2Continual LearningSpeech Processing

  23. Breaking the Quality--Intelligibility Trade-off in Streaming Target Speaker Extraction via Deep-Feature-Anchored Preference Optimization

    Jul 11, 2026Shuhai Peng, Jinjiang Liu, Hui Lu +5Target Speaker ExtractionSpeech Processing

  24. Transcript-Free Lightweight Detection of Alzheimer's Disease from Spontaneous Speech Using Handcrafted MFCC-Dominant Acoustic Biomarkers

    Jul 11, 2026Rashin Gholijani Farahani, Azam BastanfardSpeech-Based Dementia DetectionSpeech Processing

  25. Phone Segmentation and Recognition through Phonological Activation Mapping

    Jul 10, 2026Shikhar Bharadwaj, Kwanghee Choi, Stephen McIntosh +8Speech ProcessingAutomatic Speech Recognition

  26. PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction

    Jul 9, 2026Wanyi Ning, Wei Zhou, Yingpeng Li +3Target Speaker ExtractionSpeech Processing