Voice Conversion

Momentum

3 papers in the last four weeks, down 25% on the four weeks before. 0.0% of all new papers.

Jul 6Week of Sep 21

Latest papers 42

All topics
CardsList
  1. VOSSA: Voiceprint Optimization for Streaming Speech Architectures

    Sep 30, 2026Mu-Ruei Tseng, Waris Quamer, Ghady Nasrallah +1Voice ConversionWhisper-Large-V3

  2. Optimal VC Dimension of Contrastive Learning with Margin

    Sep 30, 2026Dionysis Arvanitakis, Vaggos Chatziafratis, Yiyuan Luo +1Contrastive LearningVoice Conversion

  3. RAWD-TTS: Ratio-Free Reward Alignment for Discrete-Diffusion Voice Cloning

    Sep 29, 2026Maxim Maslov, Kirill Borodin, Vasilii Kudryavtsev +2Voice ConversionSpeaker

  4. Understanding Hyperspherical Geometry of ECAPA-TDNN Embedding and Its Impact on Zero-Shot Voice Conversion

    Sep 21, 2026Mathilde Abrassart, Nicolas Obin, Axel RoebelVoice ConversionAutomatic Speaker Verification

  5. Adversarially Robust PAC Learning with Optimal VC Rates

    Sep 21, 2026Steve Hanneke, Amirreza ShaeiriBounded AdversaryLearnability

  6. Taming Long-form Text-to-Speech

    Sep 15, 2026Rongxiang Wang, Berkin Durmus, Aysegul Orhon +2Autoregressive Text-To-SpeechVoice Conversion

  7. An Optimal Agnostic PAC Algorithm

    Aug 6, 2026Markus Engelund Mathiasen, Jian Qian, Nikita ZhivotovskiyOptimal Sample ComplexitySample Complexity

  8. REIMU: Efficient Heterogeneous Hierarchical Reasoning for SSL-Based Speech Deepfake Detection

    Aug 1, 2026Kwok-Ho Ng, Tingting Song, Bingwen Feng +1Audio Deepfake DetectionVoice Conversion

  9. Expose Your Disguise: Recovering Source Speaker Identity From Voice Conversion

    Jul 26, 2026Hanlei Zhang, Zhongming Ma, Mingyang Zhang +3Voice ConversionSpeaker

  10. Synthetic Speech, Real Signal: Paralinguistic Preservation and Cross-Lingual Augmentation via Voice Cloning

    Jul 24, 2026Roseline Polle, Owen Parsons, George Fairs +5Cross-Lingual Voice CloningParalinguistic Cues

  11. Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion

    Jul 23, 2026Seolhee Lee, Minsu Kang, Yangsun Lee +3Voice ConversionVocalizations

  12. Large Audio Language Models for Spoofing-Aware Speaker Verification

    Jul 16, 2026Sofya Savelyeva, Mariia Perunova, Evgeny Kushnir +3Automatic Speaker VerificationLarge Audio Language Models

  13. Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion

    Jul 14, 2026Ben Maman, Frank Zalkow, Hans-Ulrich Berendes +3Modern Generative Audio ModelsVoice Conversion

  14. NouveauVoice: Generating Novel Pseudo Speakers for Voice Anonymization

    Jul 4, 2026Meiying Melissa Chen, Anastasia Kuznetsova, Zhenyu Wang +1Voice ConversionAnonymization

  15. GRAFT: Grafted Reference Audio for Fine-grained Pronunciation in Zero-shot Text-to-Speech

    Jul 2, 2026Antonis Asonitis, Francesco Verdini, Aref Farhadipour +4Flow-Matching Text-To-SpeechPronunciation Assessment

  16. Surprises in Proper Positive-Only Learning

    Jun 26, 2026Shai Ben-David, Farnam Mansouri, Anay Mehrotra +1LearnabilityPositive--Unlabeled Learning

  17. ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion

    Jun 20, 2026Jeongsoo Choi, Ji-Hoon Kim, Shujie Hu +1Neural Speech CodecsProsody

  18. Speaker Identity in Non-Verbal Vocalizations: Conditional Distillation and Mixture of Experts Approach

    Jun 19, 2026Tzu-Chieh Wei, Yi-Cheng Lin, Huang-Cheng Chou +4Automatic Speaker VerificationSpeaker

  19. Robust Spoofed Speech Detection via Temporal Pyramid Modeling

    Jun 15, 2026Mahtab Masoudi Nezhad, Nima KarimianSpoofingSelf-Supervised Speech Models

  20. Vocal Identity Under Siege by AI Voice Cloning Technologies

    Jun 11, 2026Jyh-An Lee, Xuan SunCross-Lingual Voice CloningVoice Conversion

  21. Tight Sample Complexity of Transformers

    Jun 8, 2026Chenxiao Yang, Nathan Srebro, Zhiyuan LiTransformer ArchitecturesSample Complexity

  22. MeanVC 2: Robust Low-Latency Streaming Zero-Shot Voice Conversion

    Jun 8, 2026Guobin Ma, Yuxuan Xia, Yuepeng Jiang +6Voice ConversionStreaming

  23. From A to B to A: Palindromic Zero-Shot Voice Conversion with Non-Parallel Data

    Jun 7, 2026Moshe Mandel, Shlomo E. ChazanVoice ConversionWav2Vec

  24. Towards Unified Song Generation and Singing Voice Conversion with Accompaniment Co-Generation

    Jun 5, 2026Ziyu Zhang, Chunyu Qiang, Xiaopeng Wang +10Singing Voice ConversionSong Generation

  25. Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning

    Jun 1, 2026Ding Ma, Jinyi Mi, Fengji Li +5Speech EnhancementDiscrete Speech Representations

  26. Contradiction Graphs Determine VC Dimension

    May 19, 2026Jesse Campbell, Daniel Ibaibarriaga, Lev ReyzinAcyclic GraphsDecision Boundaries

  27. Voice "Cloning" is Style Transfer

    May 15, 2026Kaitlyn Zhou, Federico Bianchi, Martijn Bartelds +3Cross-Lingual Voice CloningVoice Conversion

  28. Strategic PAC Learnability via Geometric Definability

    May 13, 2026Yuval Filmus, Shay Moran, Elizaveta Nesterova +2Hypothesis ClassLearnability

  29. Exploring Token-Space Manipulation in Latent Audio Tokenizers

    May 11, 2026Francesco Paissan, Luca Della Libera, Mirco Ravanelli +1Audio TokenizersNeural Audio Codecs

  30. A Fine-Grained Understanding of Uniform Convergence for Halfspaces

    May 7, 2026Aryeh Kontorovich, Kasper Green LarsenEmpirical Risk MinimizationMetric Spaces

  31. Phoneme-Level Deepfake Detection Across Emotional Conditions Using Self-Supervised Embeddings

    May 4, 2026Vamshi Nallaguntla, Shruti Kshirsagar, Anderson R. AvilaAudio Deepfake DetectionGrapheme-To-Phoneme

  32. Null Measurability at the Symmetrization Interface in VC Learning

    Apr 27, 2026Dhruv GuptaProbability MeasuresLearnability

  33. Acoustic and perceptual differences between standard and accented speech and their voice clones

    Apr 2, 2026Tianle Yang, Chengzhe Sun, Phil Rose +1Cross-Lingual Voice CloningVoice Conversion

  34. What Counts as Real? Speech Restoration and Voice Quality Conversion Pose New Challenges to Deepfake Detection

    Mar 14, 2026Shree Harsha Bokkahalli Satish, Harm Lameris, Joakim Gustafson +1Audio Deepfake DetectionSpoofing

  35. RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models

    Jan 31, 2026Ruinan Jin, Xinting Liao, Hanlin Yu +2Cross-Lingual Voice CloningVoice Conversion