Audio Generation

Momentum

9 papers in the last four weeks, up 80% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 95

All topics
CardsList
  1. Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion

    Jul 14, 2026Ben Maman, Frank Zalkow, Hans-Ulrich Berendes +3Audio Diffusion ModelsAudio Generation

  2. BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation

    Jul 13, 2026Ajitesh Jamulkar, Aritra HazraText-to-Audio GenerationAudio Editing

  3. A Production-Oriented Framework for Evaluation of SFX Generation

    Jul 10, 2026Mélodie Desbos, Yara Bahram, Eric Granger +1Speech Generation EvaluationAudio Editing

  4. DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

    Jul 5, 2026Junwon Moon, Seungbeom Kim, Yejin Lee +4TTS SynthesisDiffusion Model Fine-Tuning

  5. A Text-Steerable Instrument for Sketching Procedural Soundscapes via Language Models

    Jul 1, 2026Prabal GuptaText-to-Music GenerationControllable Music Generation

  6. Predicting Timbre Traits for Interpretable Assessment of Musical Sound Synthesizers

    Jun 29, 2026Théo Chasle Cauchy, Modan Tailleur, Lindsey Reymore +2Music Generation EvaluationMusic Information Retrieval

  7. AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation

    Jun 22, 2026Huadai Liu, Kaicheng Luo, Wen Wang +4Text-to-Audio GenerationFlow-Based Generative Modeling

  8. Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption

    Jun 19, 2026Xun Gong, Jinchuan Tian, Haoran Wang +3Audio EditingAudio Generation

  9. Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors

    Jun 17, 2026Michael Finkelson, Daniel Segal, Eitan Richardson +7TTS SynthesisControllable Speech Generation

  10. Unified Audio Generation and Editing via Joint Condition Modeling and Progressive Training

    Jun 15, 2026Haocheng Dong, Yuheng Lu, Cheng Gong +3Text-to-Audio GenerationAudio Editing

  11. FreeSonic: Training-Free Temporal-Aware Decoupled Attention for Precise Audio Editing

    Jun 13, 2026Yuxuan Jiang, Mingyang Han, Yusheng Dai +12Audio EditingAudio Diffusion Models

  12. AUDEDIT: Inversion-Free Text-Guided Editing with Pretrained Audio Flow Models

    Jun 13, 2026Zhongyuan FuAudio EditingAudio Generation

  13. FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

    Jun 12, 2026Shiyao Wang, Xijuan Zeng, Hui Wang +4Audio-Video GenerationAudio-Visual Synchronization

  14. Vocal Identity Under Siege by AI Voice Cloning Technologies

    Jun 11, 2026Jyh-An Lee, Xuan SunAudio GenerationVoice Cloning

  15. AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation

    Jun 10, 2026Zeyue Tian, Lei Ke, Zhaoyang Liu +8Text-to-Audio GenerationDiffusion Model Distillation

  16. Quality-Diversity Search in Sound Generation: Investigating Innovation Engines for Audio Exploration

    Jun 8, 2026Björn Þór Jónsson, Çağrı Erdem, Stefano Fasciani +1Evolutionary OptimizationQuality-Diversity Optimization

  17. Audio-Oscar: A Multi-Agent System for Complex Audio Scene Generation, Orchestration, and Refinement

    Jun 5, 2026Yifan Duan, Qixiang Xu, Hengtao Wu +6Text-to-Audio GenerationAudio Generation

  18. VoxCPM2 Technical Report

    Jun 5, 2026Yixuan Zhou, Guoyang Zeng, Xin Liu +15Speech Foundation ModelsControllable Speech Generation

  19. F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation

    Jun 4, 2026Dinghao Zhou, Xingchen Song, Di Wu +3Audio Representation LearningAutoencoders

  20. UniVoice: A Unified Model for Speech and Singing Voice Generation

    Jun 4, 2026Junjie Zheng, Huixin Xue, Shihong Ren +3Singing Voice SynthesisTTS Synthesis

  21. Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation

    Jun 2, 2026Ye Tao, Lupeng Liu, Xuenan Xu +6Audio-Video GenerationUnified Multimodal Models

  22. WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling

    Jun 2, 2026Wenxi Chen, Dongya Jia, Yushen Chen +11TTS SynthesisAudio Diffusion Models

  23. C2GA: A Class-Controllable Generative Augmentation Framework for Respiratory Sound Classification

    Jun 1, 2026Ziqi Ma, Mengyu Han, Anteng Cai +4Synthetic Data AugmentationAudio Classification

  24. UniVocal: Unified Speech-Singing Code-Switching Synthesis

    Jun 1, 2026Yufei Shi, Qian Chen, Wen Wang +3Singing Voice SynthesisTTS Synthesis

  25. Quality Audio Prototyping: a prototype system for unified sound retrieval and procedural generation

    May 30, 2026Nelly Garcia, Aditya Bhattacharjee, Gabryel Mason-Williams +3Audio Generation