Text-to-Audio Generation

Momentum

2 papers in the last four weeks, down 33% on the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 36

All topics
CardsList
  1. PLACE: Positional Latent Adaptation via Conditioned Embeddings for Binaural Audio Generation

    Sep 30, 2026Tiernon Riesenmy, You Zhang, Gautam Bhattacharya +1Text-to-Audio GenerationAudio-Video Generation

  2. UNITE-AUDIO: Joint Learning of Continuous Tokenization and Latent Flow Matching for Text-to-Audio Generation

    Sep 23, 2026Runwu Shi, Kai Li, Yujin Wang +8Text-to-Audio GenerationAudio Representation Learning

  3. VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

    Aug 13, 2026Wenxiang Guo, Changhao Pan, Ziyue Jiang +2Text-to-Audio GenerationPreference Optimization

  4. MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

    Aug 12, 2026Xingwei Sun, Heinrich Dinkel, Gang Li +7Text-to-Audio GenerationAutoregressive Generation

  5. SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation

    Aug 10, 2026Yunrui Cai, Xu Li, Yucheng Zhou +8Text-to-Audio GenerationMixture-of-Experts Models

  6. AudioScape-TTA: A Structured Soundscape Benchmark for Fine-Grained Text-to-Audio Evaluation

    Aug 5, 2026Jinting Wang, Yuguang Yang, Shengyu Li +4Text-to-Audio GenerationRubric-Based Evaluation

  7. AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities

    Aug 4, 2026Sandy Abdo, Bill Kapralos, Priyamvada Tripathi +2Text-to-Audio GenerationSound Effects Generation

  8. Efficient Text-to-Audio Generation via Pruning

    Jul 14, 2026Arshdeep Singh, Yi Yuan, Yun Chen +2Text-to-Audio GenerationLatent Diffusion Models

  9. BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation

    Jul 13, 2026Ajitesh Jamulkar, Aritra HazraText-to-Audio GenerationAudio Editing

  10. FdAudio: MeanFlow-Anchored Fréchet-Distance Post-Training for One-Step Text-to-Audio Generation

    Jul 11, 2026Kuan-Po Huang, Bo-Ru Lu, Ho-Lam Chung +2Text-to-Audio GenerationFlow Matching

  11. A Quantized Native Runtime for On-Device Semantic Audio Generation

    Jul 9, 2026Matteo Spanio, Antonio RodàText-to-Audio GenerationControllable Music Generation

  12. SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation

    Jun 30, 2026Binh Mai, Tran Quoc Bao Le, Hung Dinh +1Text-to-Audio GenerationDiffusion Model Distillation

  13. AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation

    Jun 22, 2026Huadai Liu, Kaicheng Luo, Wen Wang +4Text-to-Audio GenerationFlow-Based Generative Modeling

  14. STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation

    Jun 22, 2026Huadai Liu, Wen Wang, Kaicheng Luo +3Variational AutoencodersText-to-Audio Generation

  15. InstructFX2FX: A Multi-Turn Text-to-Effect System for Sequential Audio Effect Refinement

    Jun 20, 2026Song-Ze Yu, Milan Liessens Dujardin, Yuxuan Cai +4Text-to-Audio GenerationLarge Language Model-Guided Optimization

  16. Unified Audio Generation and Editing via Joint Condition Modeling and Progressive Training

    Jun 15, 2026Haocheng Dong, Yuheng Lu, Cheng Gong +3Text-to-Audio GenerationAudio Editing

  17. AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation

    Jun 10, 2026Zeyue Tian, Lei Ke, Zhaoyang Liu +8Text-to-Audio GenerationDiffusion Model Distillation

  18. Audio-Oscar: A Multi-Agent System for Complex Audio Scene Generation, Orchestration, and Refinement

    Jun 5, 2026Yifan Duan, Qixiang Xu, Hengtao Wu +6Text-to-Audio GenerationAudio Generation

  19. UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion

    May 29, 2026Zhaoqing Li, Haoning Xu, Jingran Su +9Text-to-Audio GenerationTTS Synthesis

  20. Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

    May 27, 2026Jiahao Mei, Heinrich Dinkel, Yadong Niu +7Text-to-Audio GenerationAudio Representation Learning

  21. WavFlow: Audio Generation in Waveform Space

    May 18, 2026Feiyan Zhou, Luyuan Wang, Shoufa Chen +6Text-to-Audio GenerationAudio-Video Generation

  22. Stable Audio 3

    May 18, 2026Zach Evans, Julian D. Parker, Matthew Rice +4Text-to-Audio GenerationLatent Diffusion Models

  23. CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation

    May 18, 2026Gyubin Lee, Junwon Lee, Juhan NamText-to-Audio GenerationAudio-Video Generation

  24. Taming Audio VAEs via Target-KL Regularization

    May 16, 2026Prem Seetharaman, Rithesh KumarVariational AutoencodersText-to-Audio Generation

  25. Stage-adaptive audio diffusion modeling

    May 6, 2026Xuanhao Zhang, Chang LiText-to-Audio GenerationDiffusion Model Guidance