Audio Generation

Momentum

9 papers in the last four weeks, up 80% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 95

All topics
CardsList
  1. WorldSonus: Bringing Sound to Worlds

    Oct 6, 2026Pengjun Fang, Jingyi Fa, Kam Man Wu +9Audio-Video GenerationAudio Diffusion Models

  2. Smorph: Playable Sound Morphing with Diffusion Models

    Oct 5, 2026Annie Chu, Hugo Flores García, Johannes Imort +5Diffusion Model GuidanceAudio Editing

  3. Relational Synthesis: Structure-Mediated Concatenative Synthesis for Foley and Retrieval-Augmented Audio Generation

    Oct 5, 2026Keren Shao, Ayaka Kawano, Shlomo DubnovSound Effects GenerationAudio Generation

  4. AudioGAR: Bridging Reconstruction and Generation in Latent Audio Generative Models

    Oct 5, 2026Xianghong Fang, Geeyang Tay, Wentao Ma +2Neural Audio CodecsAudio Diffusion Models

  5. Game Sound-Effect Completion with Event-Level Transformation Hints

    Sep 30, 2026Xinrui Jiang, Heng YuAudio EditingAudio Diffusion Models

  6. Audible World Models: Spatially Aware Sound Generation for 3D Worlds

    Sep 29, 2026Duowen Chen, Jinjin He, Gouthaman KV +2Sound Effects Generation3D Scene Generation

  7. YuE2: Unifying Symbolic and Audio Music Generation at Frontier Quality

    Sep 27, 2026Ruibin Yuan, Jiahao Pan, Junyan Jiang +32Audio Representation LearningControllable Music Generation

  8. Generating the Unheard: Phylogeny-Guided Latent Generation for Ancestral Sound Reconstruction

    Sep 14, 2026Tianyi Xu, Shrinaath Narasimhan, Evan Gorstein +3BioacousticsAudio Generation

  9. StepAudio 3 Gen Technical Report

    Sep 14, 2026Bin Lin, Bo Zhao, Boyang Wang +68TTS SynthesisZero-Shot TTS

  10. PhaseGAN: High-Fidelity Vocoder via Decoupled Amplitude and GAN-Driven Phase Reconstruction

    Sep 14, 2026Wenzheng Zhang, Xueliang Zhang, Shulin He +7Speech ProcessingAudio Generation

  11. Learned Continuous Synthesis of Quadratic Difference Tone Spectra

    Sep 11, 2026Esteban Gutiérrez, Behzad Haki, Christopher Haworth +2Music GenerationAudio Generation

  12. Preference Optimization with LALM Feedback for Continuous Autoregressive Non-Verbal Vocalization Generation

    Sep 10, 2026Jingbin Hu, Qirui Zhan, Yuang Cao +7Direct Preference OptimizationControllable Speech Generation

  13. VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

    Aug 13, 2026Wenxiang Guo, Changhao Pan, Ziyue Jiang +2Text-to-Audio GenerationPreference Optimization

  14. MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

    Aug 12, 2026Xingwei Sun, Heinrich Dinkel, Gang Li +7Text-to-Audio GenerationAutoregressive Generation

  15. Monophonic Audio Synthesizer Using FPGAs

    Aug 10, 2026Michael Smith, D. G. PereraAudio Generation

  16. SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation

    Aug 10, 2026Yunrui Cai, Xu Li, Yucheng Zhou +8Text-to-Audio GenerationMixture-of-Experts Models

  17. RAG-Audio: Retrieval-Augmented Generation for Faithful Brain-to-Audio Reconstruction

    Aug 10, 2026Ambuj Mehrish, Sebastiano VasconNeural DecodingMusic Generation

  18. VIOLET: High-Fidelity Violin Synthesis with Techniques and Dynamics

    Aug 8, 2026Baotong Tian, Cynthia Lu, Vincent K. M. Cheung +3Controllable Music GenerationAudio Generation

  19. MMAG: A Multi-Control Mixed Audio Generation Benchmark

    Aug 7, 2026Zihao Zheng, Xuenan Xu, Jiahao Mei +5Speech Generation EvaluationAudio Generation

  20. AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities

    Aug 4, 2026Sandy Abdo, Bill Kapralos, Priyamvada Tripathi +2Text-to-Audio GenerationSound Effects Generation

  21. CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice Synthesis

    Aug 4, 2026Yizhong Geng, Tian-Hao Zhang, Chunfeng Wang +7Singing Voice SynthesisAudio Editing

  22. Multi-Backbone Self-Supervised Ensembles for Audio Deepfake Detection and a Cross-Track Analysis of Generation-Detection Asymmetry

    Aug 3, 2026Seunghyun Kim, Junghyun Kim, Jiyoung WooAudio Deepfake DetectionDeep Ensembles

  23. Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds

    Aug 1, 2026Masaki Yoshida, Ren Togo, Takahiro Ogawa +1Spatial AudioAudio Generation

  24. Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens

    Jul 31, 2026Yi Luo, Rongzhi Gu, Jixun YaoFlow MatchingAudio Representation Learning

  25. VocalRender: Score-Native Singing Voice Synthesis for Real-World Composition

    Jul 30, 2026Yukun Chen, Tianrui Wang, Zhaoxi Mu +2Singing Voice SynthesisAudio Diffusion Models

  26. SoundscapeAgent: Agentic Soundscape Construction for Controllable Synthesis and Scalable Audio-Language Supervision

    Jul 23, 2026Hao Zhang, Yiwen Zhao, Yixuan Zhang +2Tool-Augmented Language Model AgentsAudio Generation

  27. Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion

    Jul 14, 2026Ben Maman, Frank Zalkow, Hans-Ulrich Berendes +3Audio Diffusion ModelsAudio Generation

  28. BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation

    Jul 13, 2026Ajitesh Jamulkar, Aritra HazraText-to-Audio GenerationAudio Editing

  29. A Production-Oriented Framework for Evaluation of SFX Generation

    Jul 10, 2026Mélodie Desbos, Yara Bahram, Eric Granger +1Speech Generation EvaluationAudio Editing

  30. DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

    Jul 5, 2026Junwon Moon, Seungbeom Kim, Yejin Lee +4TTS SynthesisDiffusion Model Fine-Tuning

  31. A Text-Steerable Instrument for Sketching Procedural Soundscapes via Language Models

    Jul 1, 2026Prabal GuptaText-to-Music GenerationControllable Music Generation

  32. Predicting Timbre Traits for Interpretable Assessment of Musical Sound Synthesizers

    Jun 29, 2026Théo Chasle Cauchy, Modan Tailleur, Lindsey Reymore +2Music Generation EvaluationMusic Information Retrieval

  33. AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation

    Jun 22, 2026Huadai Liu, Kaicheng Luo, Wen Wang +4Text-to-Audio GenerationFlow-Based Generative Modeling

  34. Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption

    Jun 19, 2026Xun Gong, Jinchuan Tian, Haoran Wang +3Audio EditingAudio Generation

  35. Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors

    Jun 17, 2026Michael Finkelson, Daniel Segal, Eitan Richardson +7TTS SynthesisControllable Speech Generation

  36. Unified Audio Generation and Editing via Joint Condition Modeling and Progressive Training

    Jun 15, 2026Haocheng Dong, Yuheng Lu, Cheng Gong +3Text-to-Audio GenerationAudio Editing

  37. FreeSonic: Training-Free Temporal-Aware Decoupled Attention for Precise Audio Editing

    Jun 13, 2026Yuxuan Jiang, Mingyang Han, Yusheng Dai +12Audio EditingAudio Diffusion Models

  38. AUDEDIT: Inversion-Free Text-Guided Editing with Pretrained Audio Flow Models

    Jun 13, 2026Zhongyuan FuAudio EditingAudio Generation

  39. FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

    Jun 12, 2026Shiyao Wang, Xijuan Zeng, Hui Wang +4Audio-Video GenerationAudio-Visual Synchronization

  40. Vocal Identity Under Siege by AI Voice Cloning Technologies

    Jun 11, 2026Jyh-An Lee, Xuan SunAudio GenerationVoice Cloning

  41. AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation

    Jun 10, 2026Zeyue Tian, Lei Ke, Zhaoyang Liu +8Text-to-Audio GenerationDiffusion Model Distillation

  42. Quality-Diversity Search in Sound Generation: Investigating Innovation Engines for Audio Exploration

    Jun 8, 2026Björn Þór Jónsson, Çağrı Erdem, Stefano Fasciani +1Evolutionary OptimizationQuality-Diversity Optimization

  43. Audio-Oscar: A Multi-Agent System for Complex Audio Scene Generation, Orchestration, and Refinement

    Jun 5, 2026Yifan Duan, Qixiang Xu, Hengtao Wu +6Text-to-Audio GenerationAudio Generation

  44. VoxCPM2 Technical Report

    Jun 5, 2026Yixuan Zhou, Guoyang Zeng, Xin Liu +15Speech Foundation ModelsControllable Speech Generation

  45. F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation

    Jun 4, 2026Dinghao Zhou, Xingchen Song, Di Wu +3Audio Representation LearningAutoencoders

  46. UniVoice: A Unified Model for Speech and Singing Voice Generation

    Jun 4, 2026Junjie Zheng, Huixin Xue, Shihong Ren +3Singing Voice SynthesisTTS Synthesis

  47. Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation

    Jun 2, 2026Ye Tao, Lupeng Liu, Xuenan Xu +6Audio-Video GenerationUnified Multimodal Models

  48. WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling

    Jun 2, 2026Wenxi Chen, Dongya Jia, Yushen Chen +11TTS SynthesisAudio Diffusion Models

  49. C2GA: A Class-Controllable Generative Augmentation Framework for Respiratory Sound Classification

    Jun 1, 2026Ziqi Ma, Mengyu Han, Anteng Cai +4Synthetic Data AugmentationAudio Classification

  50. UniVocal: Unified Speech-Singing Code-Switching Synthesis

    Jun 1, 2026Yufei Shi, Qian Chen, Wen Wang +3Singing Voice SynthesisTTS Synthesis

  51. Quality Audio Prototyping: a prototype system for unified sound retrieval and procedural generation

    May 30, 2026Nelly Garcia, Aditya Bhattacharjee, Gabryel Mason-Williams +3Audio Generation