Prosody

Momentum

12 papers in the last four weeks, up 140% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 53

All topics
CardsList
  1. A Novel Sentence Stress Detection Framework Leveraging Auxiliary Word-Stress Modeling and Loss Optimization

    Oct 6, 2026Tien-Hong Lo, Fong-Chun Tsai, Ting-An Hung +3Prosody

  2. Can Prosodic Style Be Inferred from Text Alone? Evidence from Unsupervised Acoustic Clusters

    Oct 4, 2026Abdul Rehman, Jian-Jun Zhang, Xiaosong YangProsody

  3. SCIC: Scope- and Codebook-Aware Instruction Conditioning for Speaker-Adapted Expressive TTS

    Sep 30, 2026Longyu Lu, Zongwei Du, Mengtao Xing +4ProsodyInstruction

  4. A barrier or a booster? Familiarity effects on Mandarin emotion prosody recognition using AI-powered voice cloning

    Sep 30, 2026Feng Xu, Gaoyuan Zhang, Shanshan Xue +4Cross-Lingual Voice CloningProsody

  5. Not Quite My Tempo: Voice Activity-aware Speech Synthesis for Lip-Synchronous Dubbing

    Sep 22, 2026Alejandro Pérez-González-de-Martos, Florian Lux, Angelina Elizarova +3Precise Lip SynchronizationSpeech Synthesis

  6. Automated Assessment of L2 Speech Rhythm Using Low-Frequency Amplitude Modulations

    Sep 21, 2026João Lima, Lucas Ueda, Paula CostaProsodyAcoustic

  7. HaikuS2S: A Cascaded System For Responding In Verse

    Sep 20, 2026Devangi Sharma, Sophia Judicke, Glenda Tan +2ProsodyPoetry

  8. Multi-Dimensional Prosody Judgment For Live Streaming Speech Synthesis

    Sep 17, 2026Zifan Guan, Longyu Lu, Junan Zhang +3ProsodyText-To-Speech Synthesis

  9. CLASH: Counterfactual Auditing of Lexical and Prosodic Reliance in Spoken Sarcasm Detection

    Sep 15, 2026Qiyang Sun, Xudong Li, Yupei Li +4ProsodyHumor

  10. Less can be More: What Aspects of Speech Drive End-of-Turn Detection

    Sep 12, 2026Rini Sharon, Manickavela A, Kadri Hacioglu +1Turn-TakingProsody

  11. LLM-Anchored Paralinguistic Enrichment for Alzheimer's Disease Detection

    Sep 9, 2026Xiao Wei, Yuqin Lin, Yaru Cao +6Paralinguistic CuesAlzheimer

  12. Stabilizing Instruction Supervision for Instruct-TTS via Controllable Diversification and Drift Filtering

    Sep 8, 2026Yizhong Geng, Kecan Mao, Qifei Li +6Instruction TuningInstruction

  13. Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech

    Sep 3, 2026Kunat Pipatanakul, Potsawee Manakul, Warit Sirichotedumrong +3Cross-Lingual Voice CloningProsody

  14. Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models

    Sep 1, 2026Bhuvan Koduru, Dareen Safar B Alharthi, Rita Singh +1Paralinguistic CuesLarge Audio Language Models

  15. Using Prosody to Predict Syntactic Structure

    Aug 31, 2026Junghyun Min, Alex Warstadt, Tamar I. Regev +2ProsodySyntactic Structure

  16. When Models Hear What They Expect: Diagnosing Prosodic Heuristics in Multimodal Sarcasm Detection

    Aug 31, 2026Yongjian Chen, Pengfei Wei, Yiqun Sun +2HumorProsody

  17. CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis

    Aug 8, 2026Zhisheng Zheng, Xiaohang Sun, Zhu Liu +5ProsodyUtterances

  18. Correlation between prosody and pragmatics: A case study of the discourse marker hālā `now' in Persian

    Jul 30, 2026Soleiman Ghaderi, Moloud Asakereh, Kevin TangPersianProsody

  19. Self-supervised Speech Comparison for L2 Phone, Rhythm, and Intonation Scoring

    Jul 15, 2026Stephen McIntosh, Reuben Smit, Daisuke Saito +2Grapheme-To-PhonemeProsody

  20. Audio-Text Cross-Attention with Psycholinguistic Support Features for Ambivalence/Hesitancy Recognition

    Jul 15, 2026Luiz F. B. F. Martins, Rodrigo W. Pisaia, Matheus M. Girardi +5ProsodyCross-Attention

  21. CHARM: Charge Calibration and Acoustic Rescue for LLM-based Multimodal Sarcasm Detection

    Jul 13, 2026Qiyang Sun, Yi Chang, Yupei Li +3HumorProsody

  22. Transcript-Free Lightweight Detection of Alzheimer's Disease from Spontaneous Speech Using Handcrafted MFCC-Dominant Acoustic Biomarkers

    Jul 11, 2026Rashin Gholijani Farahani, Azam BastanfardAlzheimerProsody

  23. Transformer-based segmentation of prosodic boundaries in Brazilian Portuguese

    Jul 8, 2026Rodrigo de Freitas Lima, Julio Cesar Galdino, Marcos Vinicius TrevisoProsodyPortuguese

  24. WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS

    Jul 7, 2026Sihang Nie, Jinxin Ji, Xiaofen Xing +4Flow-Matching Text-To-SpeechProsody

  25. Reference-Based Prosody and Rhythm Evaluation for Spoken Dialogue Systems

    Jun 30, 2026Ashish Hallur, Thomas Thebaud, Georgi Tinchev +2ProsodyMelody

  26. Do Speech Emphasis Models Generalize across Languages and Emotions?

    Jun 26, 2026Megan Wei, Deepali Aneja, Jiaqi Su +3Multilingual Automatic Speech RecognitionEmotion Recognition

  27. Adaptive Oscillatory Inductive Bias for Modeling Sharp Prosodic Dynamics in Diffusion-Based TTS

    Jun 24, 2026Sandipan Dhar, Nirmesh J. Shah, Ashishkumar P. Gudmalwar +1ProsodyInductive Bias

  28. ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion

    Jun 20, 2026Jeongsoo Choi, Ji-Hoon Kim, Shujie Hu +1Neural Speech CodecsProsody

  29. LLM-Based Multi-Reference Evaluation for Efficient and Robust Assessment of Phrase Break Annotations

    Jun 19, 2026Younghan Park, Hoyeon Lee, Hawon Jeong +1Large Language Model AnnotationsProsody

  30. Zero-VC: Zero-Lookahead Streaming Voice Conversion via Speaker Anonymization

    Jun 18, 2026Yudong Li, Zihao Fang, Junwen Qiu +4SpeakerProsody

  31. Investigating Human-Model Discrepancies in Speech Quality Assessment via Acoustic and Prosodic Perturbations

    Jun 18, 2026Masato Takagi, Masaya Kawamura, Reo Shimizu +1Seed-Tts-Eval BenchmarkProsody

  32. MagpieTTS-LF: Inference-Time Long-Form Speech Generation Without Training on Long-Form data

    Jun 16, 2026Subhankar Ghosh, Jason Li, Paarth Neekhara +4Long-Form GenerationProsody

  33. Dynamic Prosody Prediction in LLM-based TTS for Improving Speaker Similarity

    Jun 13, 2026Zhenwei Mou, Liping Chen, Yajun Hu +3ProsodyFlow-Matching Text-To-Speech

  34. Explainable and Trustworthy Speech Emotion Recognition Using Confidence Score and Reinforcement Learning Rectified Speech Emotion Descriptors

    Jun 12, 2026Youjun Chen, Xurong Xie, Mengzhe Geng +9Emotion RecognitionProsody

  35. What Makes Synthetic Speech Sound Sarcastic? A Prosody-Controlled Perception Study

    Jun 8, 2026Zhu Li, Shekhar Nayak, Matt ColerProsodyFlow-Matching Text-To-Speech

  36. ProSarc: Prosody-Aware Sarcasm Recognition Framework via Temporal Prosodic Incongruity

    Jun 4, 2026Prathamjyot Singh, Ashima Sood, Sahil Sharma +1ProsodyHumor

  37. Bridging the Gap: Converting Read Text to Conversational Dialogue

    May 18, 2026Parshav Singla, Agnik Banerjee, Aaditya Arora +5Speech SynthesisProsody

  38. A Semi-Supervised Framework for Speech Confidence Detection using Whisper

    May 12, 2026Adam Wynn, Jingyun WangSpeakerSpeech Encoder

  39. A Survey of Automated Presentation Coaching: Systems, Methods, and Open Challenges

    May 11, 2026Wen Liang, Li Siyan, Zackary Rackauckas +1Pronunciation AssessmentProsody

  40. The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation

    Apr 29, 2026Yun-Shao Tsai, Yi-Cheng Lin, Huang-Cheng Chou +5Seed-Tts-Eval BenchmarkProsody

  41. DiffAnon: Diffusion-based Prosody Control for Voice Anonymization

    Apr 29, 2026Ismail Rasim Ulgen, Zexin Cai, Nicholas Andrews +2AnonymizationProsody

  42. ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech Synthesis

    Apr 21, 2026Aoduo Li, Haoran Lv, Hongjian Xu +5Singing Voice ConversionProsody

  43. Aligning Backchannel and Dialogue Context Representations via Contrastive LLM Fine-Tuning

    Apr 17, 2026Livia Qian, Gabriel SkantzeDialogue BenchmarksLarge Language Model Backbones

  44. Hierarchical Codec Diffusion for Video-to-Speech Generation

    Apr 17, 2026Jiaxin Ye, Gaoxiang Cong, Chenhui Wang +4Audio-Video GenerationAudio-Visual Consistency

  45. Prosodic ABX: A Language-Agnostic Method for Measuring Prosodic Contrast in Speech Representations

    Apr 2, 2026Haitong Sun, Stephen McIntosh, Kwanghee Choi +3ProsodySelf-Supervised Speech Models

  46. SpokenUS: A Spoken User Simulator for Task-Oriented Dialogue

    Mar 17, 2026Jonggeun Lee, Junseong Pyo, Jeongmin Park +1Full-Duplex Voice AgentsDialogue

  47. Balalaika: Data-Centric, Prosody-Aware Annotation Pipeline for Russian Speech

    Jul 17, 2025Kirill Borodin, Nikita Vasiliev, Vasiliy Kudryavtsev +3ProsodyAutomatic Speech Recognition