Text-To-Audio

Momentum

4 papers in the last four weeks, against 2 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 37

All topics
CardsList
  1. DuplexCadence: Exact State and Execution from a Speech Model's Declared Timelines

    Sep 28, 2026Haixiao Gao, Yimin Zheng, Linyou Xiao +1Full-Duplex Speech ModelsTime-To-First-Token

  2. Qwen-Audio-Agent Technical Report

    Sep 21, 2026Chong Deng, Yunjie Ji, Yuxiang Kong +5Full-Duplex Speech ModelsText-To-Audio

  3. Audio Deepfake Detection Using Temporal Coherence Analysis

    Sep 8, 2026Justin D. Norman, Sarah BarringtonAudio Deepfake DetectionDeepfake Detection

  4. MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

    Aug 12, 2026Xingwei Sun, Heinrich Dinkel, Gang Li +7Text-To-AudioSeed-Tts-Eval Benchmark

  5. Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis

    Jul 29, 2026Jiachen Qian, Junyu LiText-To-AudioLarge Audio Language Models

  6. OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

    Jul 28, 2026Haoyang Huang, Wenjie Huang, Tianqi Xu +14Token CompressionAudio Tokenizers

  7. What the Waveform Knows: Transparent-first Speech and Audio Intelligence with Caption Studio

    Jul 21, 2026Cheng Siong Chin, Jianhua Zhang, Mohan VenkateshkumarText-To-AudioSpeaker

  8. Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio

    Jul 21, 2026Abdul Basit Tonmoy, Kazi Fardinul Hoque, Md. Shahrier Islam Arham +1Text-To-AudioMultimodal Embeddings

  9. FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

    Jul 20, 2026Krish Agarwal, Zhuoming Chen, Yanyuan Qin +3FlashMultimodal Agents

  10. Efficient Text-to-Audio Generation via Pruning

    Jul 14, 2026Arshdeep Singh, Yi Yuan, Yun Chen +2Text-To-AudioAudio Understanding

  11. FdAudio: MeanFlow-Anchored Fréchet-Distance Post-Training for One-Step Text-to-Audio Generation

    Jul 11, 2026Kuan-Po Huang, Bo-Ru Lu, Ho-Lam Chung +2Text-To-AudioAudio Understanding

  12. GigaChat Audio: Time-aware Large Audio Language Model

    Jul 11, 2026Aleksandr Kutsakov, Mariia Sadovina, Georgii Gospodinov +4Large Audio Language ModelsText-To-Audio

  13. SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation

    Jun 30, 2026Binh Mai, Tran Quoc Bao Le, Hung Dinh +1Text-To-AudioAudio Understanding

  14. Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption

    Jun 19, 2026Xun Gong, Jinchuan Tian, Haoran Wang +3Audio EditingText-To-Audio

  15. Unified Audio Generation and Editing via Joint Condition Modeling and Progressive Training

    Jun 15, 2026Haocheng Dong, Yuheng Lu, Cheng Gong +3Modern Generative Audio ModelsAudio Editing

  16. Mask, Sample, Revise: A Revisable CTMC Inference Stack for Guided Discrete Flow Matching Text-to-Speech

    Jun 12, 2026Alef Iury Siqueira Ferreira, Lucas Rafael Stefanel Gris, Luiz Fernando de Araújo Vidal +4Flow-Matching Text-To-SpeechText-To-Audio

  17. DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast

    Jun 5, 2026Zhengkun Ge, Xiaoqian Liu, Haoran Zhang +5Audio EditingText-To-Audio

  18. Forgive or forget: Understanding the context of hate in audio retrieval systems

    Jun 4, 2026Arghya Pal, Sailaja Rajanala, Raphael C. -W. Phan +1Text-To-AudioHarmful Language

  19. ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment

    May 29, 2026Jun-Hak Yun, Seung-Bin Kim, Seong-Whan LeeText-To-Speech SynthesisText-To-Audio

  20. Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation

    May 25, 2026Zhicheng Zhang, Lei Wang, Yu Zhang +1Audio-Video GenerationGenerative Video Models

  21. ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval

    May 5, 2026Honglei Zhang, Yuting Chen, Chenpeng Hu +2Text-To-AudioQuestion-Answering Benchmarks

  22. MelShield: Robust Mel-Domain Audio Watermarking for Provenance Attribution of AI Generated Synthesized Speech

    May 2, 2026Yutong Jin, Qi Li, Lingshuang Liu +1Multi-Bit WatermarkingModern Generative Audio Models

  23. AUDITA: A New Dataset to Audit Humans vs. AI Skill at Audio QA

    Apr 23, 2026Tasnim Kabir, Dmytro Kurdydyk, Aadi Palnitkar +3Audio UnderstandingText-To-Audio

  24. ATIR: Towards Audio-Text Interleaved Contextual Retrieval

    Apr 22, 2026Tong Zhao, Chenghao Zhang, Yutao Zhu +1Text-To-AudioMultimodal Retrieval

  25. Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval

    Apr 20, 2026HaeJun Yoo, Yongseop Shin, Insung Lee +2Text-To-AudioEmbedder

  26. Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models

    Apr 20, 2026Xiang He, Chenxing Li, Jinting Wang +5Audio UnderstandingText-To-Audio

  27. Cross-Modal Bayesian Low-Rank Adaptation for Uncertainty-Aware Multimodal Learning

    Apr 17, 2026Habibeh Naderi, Behrouz Haji Soleimani, Stan MatwinParameter-Efficient Fine-Tuning MethodsText-To-Audio

  28. Joint-Centric Dual Contrastive Alignment with Structure-Preserving and Information-Balanced Regularization

    Apr 17, 2026Habibeh Naderi, Behrouz Haji Soleimani, Stan MatwinContrastive AlignmentCross-Modal Attention

  29. SemanticAudio: Audio Generation and Editing in Semantic Space

    Jan 29, 2026Zheqi Dai, Guangyan Zhang, Haolin He +5Modern Generative Audio ModelsText-To-Audio

  30. Robustness assessment of large audio language models in multiple-choice evaluation

    Oct 6, 2025Fernando López, Santosh Kesiraju, Jordi LuqueLarge Audio Language ModelsText-To-Audio