Audio Generation

Momentum

9 papers in the last four weeks, up 80% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 95

All topics
CardsList
  1. UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion

    May 29, 2026Zhaoqing Li, Haoning Xu, Jingran Su +9Text-to-Audio GenerationTTS Synthesis

  2. Sound effects in media:A comparative analysis of recorded and synthetic samples in live-action and animation

    May 29, 2026Nelly Garcia, Joshua ReissSound Effects GenerationAudio Generation

  3. LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation

    May 27, 2026Zhisheng Zhang, Xiang Li, Yixuan Zhou +3Audio Token CompressionAudio Representation Learning

  4. Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

    May 27, 2026Jiahao Mei, Heinrich Dinkel, Yadong Niu +7Text-to-Audio GenerationAudio Representation Learning

  5. WavFlow: Audio Generation in Waveform Space

    May 18, 2026Feiyan Zhou, Luyuan Wang, Shoufa Chen +6Text-to-Audio GenerationAudio-Video Generation

  6. Voice "Cloning" is Style Transfer

    May 15, 2026Kaitlyn Zhou, Federico Bianchi, Martijn Bartelds +3Controllable Speech GenerationTrust in AI

  7. Break-the-Beat! Controllable MIDI-to-Drum Audio Synthesis

    May 14, 2026Shuyang Cui, Zhi Zhong, Qiyu Wu +9Controllable Music GenerationMusic Generation

  8. Seconds-Aligned PCA-DAC Latent Diffusion for Symbolic-to-Audio Drum Rendering

    May 13, 2026Konstantinos Soiledis, Maximos Kaliakatsos Papakostas, Dimos Makris +1Latent Diffusion ModelsSymbolic Music Generation

  9. AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling

    May 12, 2026Yiming Ren, Xuenan Xu, Ziyang Zhang +3TTS SynthesisHuman-in-the-Loop AI

  10. Drum Synthesis from Expressive Drum Grids via Neural Audio Codecs

    May 11, 2026Konstantinos Soiledis, Maximos Kaliakatsos-Papakostas, Dimos Makris +1Neural Audio CodecsMusic Generation

  11. Communicating Sound Through Natural Language

    May 9, 2026Emanuele Rossi, Emanuele RodolàAudio-Language ModelsAudio Generation

  12. Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation

    May 9, 2026Shihao Cheng, Jiaxu Zhang, Quanyue Song +6Audio-Video GenerationAudio-Visual Synchronization

  13. JaiTTS: A Thai Voice Cloning Model

    Apr 30, 2026Jullajak Karnjanaekarin, Pontakorn Trakuekul, Narongkorn Panitsrisit +5TTS SynthesisAudio Generation

  14. V.O.I.C.E (Voice, Ownership, Identity, Control, Expression): Risk Taxonomy of Synthetic Voice Generation From Empirical Data

    Apr 25, 2026Tanusree Sharma, Anish Krishnagiri, Lili Dudas +2TTS SynthesisAudio Generation

  15. UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions

    Apr 24, 2026Chunyu Qiang, Xiaopeng Wang, Kang Yin +11Text-to-Music GenerationText-to-Audio Generation

  16. Materialistic RIR: Material Conditioned Realistic RIR Generation

    Apr 22, 2026Mahnoor Fatima Saad, Sagnik Majumder, Kristen Grauman +1Generative ModelingConditional Generative Modeling

  17. NVV-SuperBench: Beyond Words, Beyond Quality-Benchmarking Nonverbal Vocalizations in Speech Generation

    Apr 17, 2026Liumeng Xue, Weizhen Bian, Jiahao Pan +9Speech Generation EvaluationSpeech Quality Assessment

  18. Geo2Sound: A Scalable Geo-Aligned Framework for Soundscape Generation from Satellite Imagery

    Apr 16, 2026Kunlin Wu, Yanning Wang, Haofeng Tan +6Cross-Modal AlignmentAudio Generation

  19. Acoustic and perceptual differences between standard and accented speech and their voice clones

    Apr 2, 2026Tianle Yang, Chengzhe Sun, Phil Rose +1TTS SynthesisAudio Generation

  20. Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions

    Feb 5, 2026Jinchuan Tian, Haoran Wang, Bo-Hao Su +14Audio UnderstandingAudio-Language Models

  21. RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models

    Jan 31, 2026Ruinan Jin, Xinting Liao, Hanlin Yu +2Adversarial RobustnessAudio Generation

  22. SemanticAudio: Audio Generation and Editing in Semantic Space

    Jan 29, 2026Zheqi Dai, Guangyan Zhang, Haolin He +5Text-to-Audio GenerationAudio Editing