Audio Diffusion Models

Latest papers 63

All topics
CardsList
  1. Improving Text-to-Music Generation with Human Preference Rewards

    Jun 19, 2026Yonghyun Kim, Junwon Lee, Haiwen Xia +2Text-to-Music GenerationAudio Diffusion Models

  2. RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers

    Jun 18, 2026Liting Gao, Yonggang Zhu, Yaru Chen +5Diffusion TransformerAudio Editing

  3. AdaTT: Text-Guided Instrument Timbre Transfer with Target-Adaptive Structural Control

    Jun 14, 2026Dabin Kim, Junwon Lee, Juhan NamControllable Music GenerationAudio Diffusion Models

  4. FreeSonic: Training-Free Temporal-Aware Decoupled Attention for Precise Audio Editing

    Jun 13, 2026Yuxuan Jiang, Mingyang Han, Yusheng Dai +12Audio EditingAudio Diffusion Models

  5. Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models

    Jun 8, 2026Yuxuan Chen, Haoyuan Yu, Peize HeCross-AttentionAudio Diffusion Models

  6. MeanVC 2: Robust Low-Latency Streaming Zero-Shot Voice Conversion

    Jun 8, 2026Guobin Ma, Yuxuan Xia, Yuepeng Jiang +6Diffusion TransformerAudio Diffusion Models

  7. Making the Most of Limited Data: Score-Aware Training for Text-to-Music Generation

    Jun 5, 2026Yun-Chen Cheng, Tzu-Hung Huang, Chih-Pin TanText-to-Music GenerationAudio Diffusion Models

  8. DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast

    Jun 5, 2026Zhengkun Ge, Xiaoqian Liu, Haoran Zhang +5Audio EditingAudio Diffusion Models

  9. TargetSEC: Plug-and-Play In-the-Wild Speech Emotion Conversion via Arousal-Conditioned Latent Style Diffusion

    Jun 5, 2026Constantin Alexander AugaLatent Diffusion ModelsAudio Diffusion Models

  10. WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling

    Jun 2, 2026Wenxi Chen, Dongya Jia, Yushen Chen +11TTS SynthesisAudio Diffusion Models

  11. Diffusion-Based Heart Sound Generation: Evaluation with Physiological Signal Metrics, Classifiers, and Expert Listening

    Jun 1, 2026Xinqi Bao, Jia Bi, Xin Chen +2Audio Diffusion ModelsConditional Diffusion Models

  12. AnchorSteer: Self-Discovered Concept Injection for Structure-Preserving Music Editing

    May 29, 2026Chih-Heng Chang, Keng-Seng Ho, Chih-Yu Tsai +3Audio EditingControllable Music Generation

  13. DUET: Unified Dual-Space Emotion Control for Diffusion and Flow-Matching Driven Text-to-Speech

    May 20, 2026Xu Zhang, Longbing Cao, Zhangkai WuTTS SynthesisAudio Diffusion Models

  14. A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models

    May 15, 2026Ningyuan Yang, Yize Li, Diego A. Cuji +4Audio Diffusion ModelsConditional Generative Modeling

  15. A Cold Diffusion Approach for Percussive Dereverberation

    May 11, 2026Dimos Makris, András Barják, Maximos Kaliakatsos-PapakostasAudio Diffusion Models

  16. Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration

    May 11, 2026Haowen Li, Tianxiang Li, Yi Yang +2Audio EditingControllable Music Generation

  17. Stage-adaptive audio diffusion modeling

    May 6, 2026Xuanhao Zhang, Chang LiText-to-Audio GenerationDiffusion Model Guidance

  18. DiffAnon: Diffusion-based Prosody Control for Voice Anonymization

    Apr 29, 2026Ismail Rasim Ulgen, Zexin Cai, Nicholas Andrews +2Audio Diffusion ModelsSpeech Prosody

  19. Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation

    Apr 19, 2026Vaibhavi Lokegaonkar, Aryan Vijay Bhosale, Vishnu Raj +5Controllable Music GenerationAudio Diffusion Models

  20. DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio

    Apr 10, 2026Wataru Nakata, Yuki Saito, Kazuki Yamauchi +2Audio Diffusion ModelsSpeech Processing

  21. Controllable Accent Normalization via Discrete Diffusion

    Mar 15, 2026Qibing Bai, Yuhan Du, Tom Ko +3Audio Diffusion ModelsSpeech Processing