Speaker Similarity

Momentum

5 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 6Week of Sep 21

Latest papers 28

All topics
CardsList
  1. Unsupervised Speech Enhancement via Drifting

    Sep 28, 2026Diego Caviedes-Nozal, Liang Xu, Rasmus Kongsgaard Olsson +1Speech EnhancementSpeaker Similarity

  2. Harmonizing Spectral Evolution in Conditional Flow Matching for TTS

    Sep 28, 2026Isha Pandey, Varad Deshpande, Abhijat Bharadwaj +1Flow-Matching Text-To-SpeechSpeaker Similarity

  3. Rethinking Automated Voice Similarity by Shifting from EER to Embedding Geometry

    Sep 27, 2026Szu-Chi Chen, Jia-Kai Dong, Yi-Cheng Lin +2Speaker SimilaritySpeaker

  4. Forget who you Forgot: Speaker Unlearning to Prevent Re-Identification in Zero-Shot Text-to-Speech

    Sep 23, 2026Hyoeun Kim, Yujun Lee, Kyuhong ShimFlow-Matching Text-To-SpeechSpeaker

  5. Cross-Lingual F5-TTS 2: A Simplified Framework for Language-Agnostic Voice Cloning

    Sep 14, 2026Qingyu Liu, Rixi Xu, Yushen Chen +11Cross-Lingual Voice CloningF5-Tts

  6. GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model

    Aug 4, 2026Guanrou Yang, Tian Tan, Qian Chen +8Flow-Matching Text-To-SpeechSpeaker Similarity

  7. DDSynth-RL: Audio Synthesizer Inversion via Discrete Diffusion with Reinforcement Learning

    Aug 4, 2026Tristan Wu, Daniel Chin, Junan Zhang +3SynthesizerModern Generative Audio Models

  8. SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings

    Jul 16, 2026Shuai Wang, Zihan Qian, Ke Zhang +9Target Speaker ExtractionSpeaker

  9. PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction

    Jul 9, 2026Wanyi Ning, Wei Zhou, Yingpeng Li +3Target Speaker ExtractionSpeaker Similarity

  10. DG^VoiC: Speaker Clustering for Fraud Investigation under Real Call-Centre Conditions

    Jun 26, 2026Muhammad Shakeel Akram, Amal Htait, Abdul Hamid Sadka +2SpeakerFraud Detection

  11. ZONOS2 Technical Report

    Jun 23, 2026Gabriel Clark, Sofian Mejjoute, Mohamed Osman +2Seed-Tts-Eval BenchmarkSpeaker Similarity

  12. Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead

    Jun 20, 2026Muyang Du, Jason Roche, Junjie LaiText-To-Speech SynthesisF5-Tts

  13. Dynamic Prosody Prediction in LLM-based TTS for Improving Speaker Similarity

    Jun 13, 2026Zhenwei Mou, Liping Chen, Yajun Hu +3ProsodyFlow-Matching Text-To-Speech

  14. DeRA-MOS: Optimizing Text-to-Music Evaluation via Decoupled Listwise Ranking and Modality Alignment

    Jun 8, 2026Chien-Chun Wang, Hung-Shin Lee, Hsin-Min Wang +1Text-To-MusicSeed-Tts-Eval Benchmark

  15. Do speech foundation models perceive speaker similarity as humans do?

    Jun 4, 2026Minoru Kishi, Hayato Yagi, Shinnosuke Takamichi +1Speaker SimilaritySpeaker

  16. MERIT: Learning Disentangled Music Representations for Audio Similarity

    May 26, 2026Abhinaba Roy, Junyi Liang, Dorien HerremansMusic Structure AnalysisAudio Understanding

  17. Detecting Synthetic Political Narratives in Cross-Platform Social Media Discourse

    May 20, 2026Despoina Antonakaki, Sotiris IoannidisPolitical DiscourseGeopolitical Grounding Interacts

  18. One Voice, Many Tongues: Cross-Lingual Voice Cloning for Scientific Speech

    Apr 28, 2026Amanuel Gizachew Abebe, Yasmin MoslemCross-Lingual Voice CloningMultilingual Automatic Speech Recognition

  19. RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models

    Jan 31, 2026Ruinan Jin, Xinting Liao, Hanlin Yu +2Cross-Lingual Voice CloningVoice Conversion