Modern Generative Audio Models

Momentum

8 papers in the last four weeks, up 167% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 48

All topics
CardsList
  1. Relational Synthesis: Structure-Mediated Concatenative Synthesis for Foley and Retrieval-Augmented Audio Generation

    Oct 5, 2026Keren Shao, Ayaka Kawano, Shlomo DubnovModern Generative Audio Models

  2. AudioGAR: Bridging Reconstruction and Generation in Latent Audio Generative Models

    Oct 5, 2026Xianghong Fang, Geeyang Tay, Wentao Ma +2Modern Generative Audio Models

  3. Audible World Models: Spatially Aware Sound Generation for 3D Worlds

    Sep 29, 2026Duowen Chen, Jinjin He, Gouthaman KV +2Spatial AudioModern Generative Audio Models

  4. UNITE-AUDIO: Joint Learning of Continuous Tokenization and Latent Flow Matching for Text-to-Audio Generation

    Sep 23, 2026Runwu Shi, Kai Li, Yujin Wang +8Modern Generative Audio ModelsAudio Tokenizers

  5. A Stem-Agnostic Approach to Hybrid AI Music Detection

    Sep 22, 2026Richa Namballa, François Rigaud, Romain HennequinGenerative MusicSpeech Separation

  6. Beyond Word Error Rate: A Switch Aware Evaluation of ASR and Audio Language Models on English Yoruba Code-Switched Speech

    Sep 12, 2026Chibuzor Okocha, Christan Earl GrantCode-SwitchingAutomatic Speech Recognition Evaluation

  7. Drive-to-Music: Context-Aware Generative Audio for In-Vehicle Experiences

    Aug 12, 2026Cosmin Dragoiu, Nooshin NabizadehModern Generative Audio ModelsText-To-Music

  8. SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation

    Aug 10, 2026Yunrui Cai, Xu Li, Yucheng Zhou +8Modern Generative Audio ModelsAudio Understanding

  9. MMAG: A Multi-Control Mixed Audio Generation Benchmark

    Aug 7, 2026Zihao Zheng, Xuenan Xu, Jiahao Mei +5Modern Generative Audio ModelsAudio-Video Generation

  10. AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities

    Aug 4, 2026Sandy Abdo, Bill Kapralos, Priyamvada Tripathi +2Modern Generative Audio ModelsGenerative Artificial Intelligence

  11. DDSynth-RL: Audio Synthesizer Inversion via Discrete Diffusion with Reinforcement Learning

    Aug 4, 2026Tristan Wu, Daniel Chin, Junan Zhang +3SynthesizerModern Generative Audio Models

  12. SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks

    Aug 3, 2026Yu Zhang, Ruiqi Li, Changhao Pan +3Modern Generative Audio Models

  13. AnyBand: Unified Multi-Bandwidth Speech Extension via Frequency-Aware In-Context Spectral Infilling

    Aug 1, 2026Junchuan Zhao, Minh Duc Vu, Bowen Zhang +1Speech EnhancementBandwidth Extension

  14. Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds

    Aug 1, 2026Masaki Yoshida, Ren Togo, Takahiro Ogawa +1Spatial Audio3D Gaussian

  15. SoundscapeAgent: Agentic Soundscape Construction for Controllable Synthesis and Scalable Audio-Language Supervision

    Jul 23, 2026Hao Zhang, Yiwen Zhao, Yixuan Zhang +2Modern Generative Audio ModelsAgentic

  16. Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion

    Jul 14, 2026Ben Maman, Frank Zalkow, Hans-Ulrich Berendes +3Modern Generative Audio ModelsVoice Conversion

  17. A Production-Oriented Framework for Evaluation of SFX Generation

    Jul 10, 2026Mélodie Desbos, Yara Bahram, Eric Granger +1Modern Generative Audio Models

  18. AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation

    Jun 22, 2026Huadai Liu, Kaicheng Luo, Wen Wang +4Modern Generative Audio ModelsAcoustic Latent Space

  19. STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation

    Jun 22, 2026Huadai Liu, Wen Wang, Kaicheng Luo +3Star-VaeModern Generative Audio Models

  20. Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors

    Jun 17, 2026Michael Finkelson, Daniel Segal, Eitan Richardson +7Modern Generative Audio ModelsSpeaker

  21. Unified Audio Generation and Editing via Joint Condition Modeling and Progressive Training

    Jun 15, 2026Haocheng Dong, Yuheng Lu, Cheng Gong +3Modern Generative Audio ModelsAudio Editing

  22. AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation

    Jun 10, 2026Zeyue Tian, Lei Ke, Zhaoyang Liu +8Modern Generative Audio ModelsMultimodal Generation

  23. Audio-Oscar: A Multi-Agent System for Complex Audio Scene Generation, Orchestration, and Refinement

    Jun 5, 2026Yifan Duan, Qixiang Xu, Hengtao Wu +6Modern Generative Audio ModelsOrchestration

  24. Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation

    Jun 2, 2026Ye Tao, Lupeng Liu, Xuenan Xu +6Modern Generative Audio ModelsMultimodal Generation

  25. Quality Audio Prototyping: a prototype system for unified sound retrieval and procedural generation

    May 30, 2026Nelly Garcia, Aditya Bhattacharjee, Gabryel Mason-Williams +3Modern Generative Audio ModelsAudio Understanding

  26. UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion

    May 29, 2026Zhaoqing Li, Haoning Xu, Jingran Su +9Modern Generative Audio ModelsLatent Diffusion Model

  27. Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

    May 27, 2026Jiahao Mei, Heinrich Dinkel, Yadong Niu +7Modern Generative Audio ModelsAcoustic Latent Space

  28. WavFlow: Audio Generation in Waveform Space

    May 18, 2026Feiyan Zhou, Luyuan Wang, Shoufa Chen +6Modern Generative Audio ModelsAudio Understanding

  29. Stable Audio 3

    May 18, 2026Zach Evans, Julian D. Parker, Matthew Rice +4Modern Generative Audio ModelsAudio Understanding

  30. Stage-adaptive audio diffusion modeling

    May 6, 2026Xuanhao Zhang, Chang LiModern Generative Audio Models

  31. JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions

    May 6, 2026Leying Zhang, Bowen Shi, Haibin Wu +2Modern Generative Audio ModelsInstruction

  32. MelShield: Robust Mel-Domain Audio Watermarking for Provenance Attribution of AI Generated Synthesized Speech

    May 2, 2026Yutong Jin, Qi Li, Lingshuang Liu +1Multi-Bit WatermarkingModern Generative Audio Models

  33. MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video

    May 1, 2026Kazuya Tateishi, Akira Takahashi, Atsuo Hiroe +3Modern Generative Audio ModelsSound Event Detection

  34. UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions

    Apr 24, 2026Chunyu Qiang, Xiaopeng Wang, Kang Yin +11Modern Generative Audio ModelsText-To-Music

  35. MAGE: Modality-Agnostic Music Generation and Target-Source Extraction

    Apr 10, 2026Muhammad Usama Saleem, Tejasvi Ravi, Tianyu Xu +4Modern Generative Audio ModelsMultimodal Generation

  36. HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation

    Apr 10, 2026Jian Zhu, Jianwei Cui, Yunlong Xue +4AccompanimentModern Generative Audio Models

  37. Towards Robust Speech Deepfake Detection via Human-Inspired Reasoning

    Mar 11, 2026Artem Dvirniak, Evgeny Kushnir, Dmitrii Tarasov +5Audio Deepfake DetectionDeepfake Detection

  38. RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models

    Jan 31, 2026Ruinan Jin, Xinting Liao, Hanlin Yu +2Cross-Lingual Voice CloningVoice Conversion

  39. SemanticAudio: Audio Generation and Editing in Semantic Space

    Jan 29, 2026Zheqi Dai, Guangyan Zhang, Haolin He +5Modern Generative Audio ModelsText-To-Audio