Audio Generation

Momentum

9 papers in the last four weeks, up 80% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 95

All topics
CardsList
  1. WorldSonus: Bringing Sound to Worlds

    Oct 6, 2026Pengjun Fang, Jingyi Fa, Kam Man Wu +9Audio-Video GenerationAudio Diffusion Models

  2. Smorph: Playable Sound Morphing with Diffusion Models

    Oct 5, 2026Annie Chu, Hugo Flores García, Johannes Imort +5Diffusion Model GuidanceAudio Editing

  3. Relational Synthesis: Structure-Mediated Concatenative Synthesis for Foley and Retrieval-Augmented Audio Generation

    Oct 5, 2026Keren Shao, Ayaka Kawano, Shlomo DubnovSound Effects GenerationAudio Generation

  4. AudioGAR: Bridging Reconstruction and Generation in Latent Audio Generative Models

    Oct 5, 2026Xianghong Fang, Geeyang Tay, Wentao Ma +2Neural Audio CodecsAudio Diffusion Models

  5. Game Sound-Effect Completion with Event-Level Transformation Hints

    Sep 30, 2026Xinrui Jiang, Heng YuAudio EditingAudio Diffusion Models

  6. Audible World Models: Spatially Aware Sound Generation for 3D Worlds

    Sep 29, 2026Duowen Chen, Jinjin He, Gouthaman KV +2Sound Effects Generation3D Scene Generation

  7. YuE2: Unifying Symbolic and Audio Music Generation at Frontier Quality

    Sep 27, 2026Ruibin Yuan, Jiahao Pan, Junyan Jiang +32Audio Representation LearningControllable Music Generation

  8. Generating the Unheard: Phylogeny-Guided Latent Generation for Ancestral Sound Reconstruction

    Sep 14, 2026Tianyi Xu, Shrinaath Narasimhan, Evan Gorstein +3BioacousticsAudio Generation

  9. PhaseGAN: High-Fidelity Vocoder via Decoupled Amplitude and GAN-Driven Phase Reconstruction

    Sep 14, 2026Wenzheng Zhang, Xueliang Zhang, Shulin He +7Speech ProcessingAudio Generation

  10. StepAudio 3 Gen Technical Report

    Sep 14, 2026Bin Lin, Bo Zhao, Boyang Wang +68TTS SynthesisZero-Shot TTS

  11. Learned Continuous Synthesis of Quadratic Difference Tone Spectra

    Sep 11, 2026Esteban Gutiérrez, Behzad Haki, Christopher Haworth +2Music GenerationAudio Generation

  12. Preference Optimization with LALM Feedback for Continuous Autoregressive Non-Verbal Vocalization Generation

    Sep 10, 2026Jingbin Hu, Qirui Zhan, Yuang Cao +7Direct Preference OptimizationControllable Speech Generation

  13. VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

    Aug 13, 2026Wenxiang Guo, Changhao Pan, Ziyue Jiang +2Text-to-Audio GenerationPreference Optimization

  14. MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

    Aug 12, 2026Xingwei Sun, Heinrich Dinkel, Gang Li +7Text-to-Audio GenerationAutoregressive Generation

  15. Monophonic Audio Synthesizer Using FPGAs

    Aug 10, 2026Michael Smith, D. G. PereraAudio Generation

  16. SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation

    Aug 10, 2026Yunrui Cai, Xu Li, Yucheng Zhou +8Text-to-Audio GenerationMixture-of-Experts Models

  17. RAG-Audio: Retrieval-Augmented Generation for Faithful Brain-to-Audio Reconstruction

    Aug 10, 2026Ambuj Mehrish, Sebastiano VasconNeural DecodingMusic Generation

  18. VIOLET: High-Fidelity Violin Synthesis with Techniques and Dynamics

    Aug 8, 2026Baotong Tian, Cynthia Lu, Vincent K. M. Cheung +3Controllable Music GenerationAudio Generation

  19. MMAG: A Multi-Control Mixed Audio Generation Benchmark

    Aug 7, 2026Zihao Zheng, Xuenan Xu, Jiahao Mei +5Speech Generation EvaluationAudio Generation

  20. AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities

    Aug 4, 2026Sandy Abdo, Bill Kapralos, Priyamvada Tripathi +2Text-to-Audio GenerationSound Effects Generation

  21. CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice Synthesis

    Aug 4, 2026Yizhong Geng, Tian-Hao Zhang, Chunfeng Wang +7Singing Voice SynthesisAudio Editing

  22. Multi-Backbone Self-Supervised Ensembles for Audio Deepfake Detection and a Cross-Track Analysis of Generation-Detection Asymmetry

    Aug 3, 2026Seunghyun Kim, Junghyun Kim, Jiyoung WooAudio Deepfake DetectionDeep Ensembles

  23. Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds

    Aug 1, 2026Masaki Yoshida, Ren Togo, Takahiro Ogawa +1Spatial AudioAudio Generation

  24. Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens

    Jul 31, 2026Yi Luo, Rongzhi Gu, Jixun YaoFlow MatchingAudio Representation Learning

  25. VocalRender: Score-Native Singing Voice Synthesis for Real-World Composition

    Jul 30, 2026Yukun Chen, Tianrui Wang, Zhaoxi Mu +2Singing Voice SynthesisAudio Diffusion Models

  26. SoundscapeAgent: Agentic Soundscape Construction for Controllable Synthesis and Scalable Audio-Language Supervision

    Jul 23, 2026Hao Zhang, Yiwen Zhao, Yixuan Zhang +2Tool-Augmented Language Model AgentsAudio Generation