Audio Diffusion Models

Latest papers 63

All topics
CardsList
  1. Beyond Token Revision: Investigating Mask-and-Replace Diffusion for Zero-Shot Text-to-Speech

    Oct 7, 2026Hounsu Kim, Joonyong Park, Yuki Saito +2Zero-Shot TTSAudio Diffusion Models

  2. VM-ARRAYDPS: Virtual Microphone Augmented Diffusion Posterior Sampling for Unsupervised Blind Speech Separation

    Oct 7, 2026Jingqi Sun, Haozhan Tang, Shulin He +1Speech SeparationDiffusion-Based Inverse Problems

  3. WorldSonus: Bringing Sound to Worlds

    Oct 6, 2026Pengjun Fang, Jingyi Fa, Kam Man Wu +9Audio-Video GenerationAudio Diffusion Models

  4. Adapting a Latent Audio Diffusion Model to Historical Guqin Recordings: A Listening-Driven Case Study

    Oct 5, 2026Huanchen CaiText-to-Music GenerationMusic Generation Evaluation

  5. AuraSE: Low-Hallucination Generative Speech Enhancement via Multimodal Flow Matching and Inference Policy Optimization

    Oct 5, 2026Yingda Shen, Yao Qian, Yuxuan Hu +7Inference-Time OptimizationAudio Diffusion Models

  6. Smorph: Playable Sound Morphing with Diffusion Models

    Oct 5, 2026Annie Chu, Hugo Flores García, Johannes Imort +5Diffusion Model GuidanceAudio Editing

  7. AudioGAR: Bridging Reconstruction and Generation in Latent Audio Generative Models

    Oct 5, 2026Xianghong Fang, Geeyang Tay, Wentao Ma +2Neural Audio CodecsAudio Diffusion Models

  8. Ghost in the Encoder: Decodable Artist Identity Representations in Lyrics-to-Song Generation

    Sep 30, 2026Arhan Vohra, Choenden Kyirong, Laura Ibáñez-Martínez +1Text-to-Music GenerationAudio Diffusion Models

  9. Game Sound-Effect Completion with Event-Level Transformation Hints

    Sep 30, 2026Xinrui Jiang, Heng YuAudio EditingAudio Diffusion Models

  10. RAWD-TTS: Ratio-Free Reward Alignment for Discrete-Diffusion Voice Cloning

    Sep 29, 2026Maxim Maslov, Kirill Borodin, Vasilii Kudryavtsev +2Audio Diffusion ModelsZero-Shot TTS

  11. DiffSynth-Music: Audio-Conditioned KV-Cache Adapters for Controllable Music Generation

    Sep 14, 2026Zhongjie Duan, Shengchuan Gao, Hong Zhang +1Controllable Music GenerationAudio Diffusion Models

  12. HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion

    Aug 12, 2026Wenshuo Peng, Kaipeng ZhangAudio-Video GenerationAudio Diffusion Models

  13. Diff2Mix: Controllable Music Mixing via Diffusion Models and Differentiable Audio Effects

    Aug 5, 2026Yisu Zong, Jinjie Shi, Joshua ReissControllable Music GenerationAudio Diffusion Models

  14. Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing

    Aug 5, 2026Iftach Shoham, Tali Dror, Oren Gal +3Speech EditingAudio Diffusion Models

  15. Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

    Aug 5, 2026Zehua Chen, Junyou Wang, Yuxuan Jiang +5Audio-Video GenerationAudio Diffusion Models

  16. On the Geometry of Music Bandwidth Extension in Latent Spaces of Audio Codecs

    Aug 4, 2026Hendrik Vincent Koops, Hao Hao Tan, Elio QuintonNeural Audio CodecsNeural Representation Geometry

  17. GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model

    Aug 4, 2026Guanrou Yang, Tian Tan, Qian Chen +8Flow MatchingTTS Synthesis

  18. AnyBand: Unified Multi-Bandwidth Speech Extension via Frequency-Aware In-Context Spectral Infilling

    Aug 1, 2026Junchuan Zhao, Minh Duc Vu, Bowen Zhang +1Audio Diffusion ModelsSpeech Enhancement

  19. VocalRender: Score-Native Singing Voice Synthesis for Real-World Composition

    Jul 30, 2026Yukun Chen, Tianrui Wang, Zhaoxi Mu +2Singing Voice SynthesisAudio Diffusion Models

  20. WanSong v1.0 Technical Report

    Jul 16, 2026Binghui Chen, Pandeng Li, Yu Liu +1Controllable Music GenerationAudio Diffusion Models

  21. Efficient Text-to-Audio Generation via Pruning

    Jul 14, 2026Arshdeep Singh, Yi Yuan, Yun Chen +2Text-to-Audio GenerationLatent Diffusion Models

  22. Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion

    Jul 14, 2026Ben Maman, Frank Zalkow, Hans-Ulrich Berendes +3Audio Diffusion ModelsAudio Generation

  23. UD-ASD: A Unified Diffusion Model for Anomalous Sound Detection

    Jul 14, 2026Pengxiang Gao, Yu Qiu, Yanzhi SongAudio Diffusion ModelsFault Detection

  24. ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models

    Jul 10, 2026Sang-Hoon Lee, Ha-Yeong ChoiAudio Representation LearningLatent Diffusion Models

  25. A Quantized Native Runtime for On-Device Semantic Audio Generation

    Jul 9, 2026Matteo Spanio, Antonio RodàText-to-Audio GenerationControllable Music Generation

  26. EscFOA: Enhancing Spatial Learning for Visually Impaired Learners via Generative Spatial Audio in 360-Degree Educational Environments

    Jul 8, 2026Ziyu Luo, Xiaowei Dai, Siying Zhu +1Audio Diffusion ModelsSpatial Audio

  27. Adaptive Oscillatory Inductive Bias for Modeling Sharp Prosodic Dynamics in Diffusion-Based TTS

    Jun 24, 2026Sandipan Dhar, Nirmesh J. Shah, Ashishkumar P. Gudmalwar +1TTS SynthesisAudio Diffusion Models

  28. Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework

    Jun 21, 2026Shuubham Ojha, Carol Espy-WilsonAudio Diffusion ModelsSpeech Enhancement