Audio-Video Generation

Latest papers 101

All topics
CardsList
  1. Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

    Apr 26, 2026Zhen Ye, Xu Tan, Aoxiong Yin +8Cross-Modal LearningAudio-Video Generation

  2. MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation

    Apr 21, 2026Liyang Li, Wen Wang, Canyu Zhao +4Diffusion Model GuidanceAudio-Video Generation

  3. OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation

    Apr 20, 2026Lei Zhu, Xing Cai, Yingjie Chen +6Audio-Video GenerationVideo Generation

  4. Hierarchical Codec Diffusion for Video-to-Speech Generation

    Apr 17, 2026Jiaxin Ye, Gaoxiang Cong, Chenhui Wang +4Audio-Video GenerationDiffusion Transformer

  5. ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling

    Apr 16, 2026Jianxuan Yang, Xinyue Guo, Zhi Cheng +10Audio-Video GenerationMultimodal Generation

  6. TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation

    Apr 16, 2026Xiangyu Liu, Feng Gao, Xiaomei Zhang +4Audio-Video GenerationVideo Diffusion Models

  7. EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation

    Dec 31, 2025Bingxuan Li, Yiming Cui, Yicheng He +4Audio-Video GenerationSound Effects Generation

  8. Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction

    Oct 3, 2025Kaisi Guan, Xihua Wang, Zhengfeng Lai +5Audio-Video GenerationVideo Diffusion Models

  9. Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance

    Jun 26, 2025Akio Hayakawa, Masato Ishii, Takashi Shibuya +1Audio-Video GenerationSound Effects Generation

  10. From Pixels to Portraits: A Comprehensive Survey of Talking Head Generation Techniques and Applications

    Aug 30, 2023Shreyank N Gowda, Dheeraj Pandey, Shashank Narayana GowdaAudio-Video GenerationTalking Head Generation