Audio-Video Generation

Latest papers 101

All topics
CardsList
  1. Benchmarking Single-Factor Physical Video-to-Audio Generation

    May 28, 2026Tingle Li, Siddharth Gururani, Kevin J. Shih +6Audio-Video GenerationAudio-Visual Alignment

  2. Native Audio-Visual Alignment for Generation

    May 28, 2026Longbin Ji, Guan Wang, Xuan Wei +6Audio-Video GenerationAudio-Visual Synchronization

  3. CapTalk: Text-Guided Stylization and Speech-Driven 3D Head Animation

    May 28, 2026Xuangeng Chu, Yuan Gan, Ziteng Cui +4Audio-Video GenerationTalking Head Generation

  4. MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation

    May 27, 2026Haitian Li, Yanghao Zhou, Heyan Huang +15Audio-Video GenerationMultimodal Model Evaluation

  5. BEAT: Rhythm-Elastic Alignment for Agentic Music-guided Movie Trailer Generation

    May 26, 2026Yutong Wang, Yunke Wang, Xinyuan Chen +1Audio-Video GenerationVideo Generation

  6. LongCat-Video-Avatar 1.5 Technical Report

    May 26, 2026Meituan LongCat Team, Xunliang Cai, Meng Cheng +10Audio-Video GenerationLong Video Generation

  7. Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation

    May 24, 2026Shuyuan Tu, Qi Tian, Zihan Yang +9Cross-Modal LearningAudio-Video Generation

  8. AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models

    May 23, 2026Jialiang Yang, Bin Xia, Ruihang Chu +6Audio-Video GenerationAudio-Visual Alignment

  9. MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

    May 19, 2026Yujie Wei, Yujin Han, Zhekai Chen +20Audio-Video GenerationAudio-Visual Alignment

  10. WavFlow: Audio Generation in Waveform Space

    May 18, 2026Feiyan Zhou, Luyuan Wang, Shoufa Chen +6Text-to-Audio GenerationAudio-Video Generation

  11. InstructAV2AV: Instruction-Guided Audio-Video Joint Editing

    May 18, 2026Haojie Zheng, Yixin Yang, Siqi Yang +2Audio-Video GenerationVideo Diffusion Models

  12. CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation

    May 18, 2026Gyubin Lee, Junwon Lee, Juhan NamText-to-Audio GenerationAudio-Video Generation

  13. Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

    May 17, 2026Yuheng Chen, Qingdong He, Teng Hu +4Audio-Video GenerationAudio-Visual Synchronization

  14. Sound Sparks Motion: Audio and Text Tuning for Video Editing

    May 14, 2026AmirHossein Naghi Razlighi, Aryan Mikaeili, Ali Mahdavi-Amiri +2Audio-Video GenerationInference-Time Optimization

  15. OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

    May 12, 2026Guohui Zhang, XiaoXiao Ma, Jie Huang +9Audio-Video GenerationAudio-Visual Synchronization

  16. AllocMV: Optimal Resource Allocation for Music Video Generation via Structured Persistent State

    May 11, 2026Huimin Wang, Leilei Ouyang, Chang Xia +3Audio-Video GenerationLong-Horizon Video Generation

  17. Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation

    May 9, 2026Shihao Cheng, Jiaxu Zhang, Quanyue Song +6Audio-Video GenerationAudio-Visual Synchronization

  18. Do Joint Audio-Video Generation Models Understand Physics?

    May 8, 2026Zijun Cui, Xiulong Liu, Hao Fang +8Physical Consistency in Video GenerationAudio-Video Generation

  19. Audio-Visual Intelligence in Large Foundation Models

    May 5, 2026You Qin, Kai Liu, Shengqiong Wu +12Audio-Visual UnderstandingAudio-Video Generation

  20. MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video

    May 1, 2026Kazuya Tateishi, Akira Takahashi, Atsuo Hiroe +3Audio-Video GenerationSound Event Detection

  21. Generate Your Talking Avatar from Video Reference

    Apr 30, 2026Zujin Guo, Zhenhui Ye, Yi Ren +4Video-Reference Video GenerationAudio-Video Generation

  22. Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation

    Apr 28, 2026Yupeng Zhou, Lianghua Huang, Zhifan Wu +7Audio-Video GenerationLong-Horizon Video Generation

  23. Talking Slide Avatars: Open-Source Multimodal Communication Approach for Teaching

    Apr 26, 2026Xinxing WuAudio-Video GenerationEducational Technology

  24. Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

    Apr 26, 2026Chunyu Li, Jiaye Li, Ruiqiao Mei +4Audio-Video GenerationVideo Diffusion Models

  25. Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

    Apr 26, 2026Zhen Ye, Xu Tan, Aoxiong Yin +8Cross-Modal LearningAudio-Video Generation

  26. MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation

    Apr 21, 2026Liyang Li, Wen Wang, Canyu Zhao +4Diffusion Model GuidanceAudio-Video Generation

  27. OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation

    Apr 20, 2026Lei Zhu, Xing Cai, Yingjie Chen +6Audio-Video GenerationVideo Generation

  28. Hierarchical Codec Diffusion for Video-to-Speech Generation

    Apr 17, 2026Jiaxin Ye, Gaoxiang Cong, Chenhui Wang +4Audio-Video GenerationDiffusion Transformer

  29. ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling

    Apr 16, 2026Jianxuan Yang, Xinyue Guo, Zhi Cheng +10Audio-Video GenerationMultimodal Generation

  30. TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation

    Apr 16, 2026Xiangyu Liu, Feng Gao, Xiaomei Zhang +4Audio-Video GenerationVideo Diffusion Models

  31. EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation

    Dec 31, 2025Bingxuan Li, Yiming Cui, Yicheng He +4Audio-Video GenerationSound Effects Generation

  32. Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction

    Oct 3, 2025Kaisi Guan, Xihua Wang, Zhengfeng Lai +5Audio-Video GenerationVideo Diffusion Models

  33. Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance

    Jun 26, 2025Akio Hayakawa, Masato Ishii, Takashi Shibuya +1Audio-Video GenerationSound Effects Generation

  34. From Pixels to Portraits: A Comprehensive Survey of Talking Head Generation Techniques and Applications

    Aug 30, 2023Shreyank N Gowda, Dheeraj Pandey, Shashank Narayana GowdaAudio-Video GenerationTalking Head Generation