Audio-Video Generation

Latest papers 101

All topics
CardsList
  1. Benchmarking Single-Factor Physical Video-to-Audio Generation

    May 28, 2026Tingle Li, Siddharth Gururani, Kevin J. Shih +6Audio-Video GenerationAudio-Visual Alignment

  2. Native Audio-Visual Alignment for Generation

    May 28, 2026Longbin Ji, Guan Wang, Xuan Wei +6Audio-Video GenerationAudio-Visual Synchronization

  3. CapTalk: Text-Guided Stylization and Speech-Driven 3D Head Animation

    May 28, 2026Xuangeng Chu, Yuan Gan, Ziteng Cui +4Audio-Video GenerationTalking Head Generation

  4. MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation

    May 27, 2026Haitian Li, Yanghao Zhou, Heyan Huang +15Audio-Video GenerationMultimodal Model Evaluation

  5. BEAT: Rhythm-Elastic Alignment for Agentic Music-guided Movie Trailer Generation

    May 26, 2026Yutong Wang, Yunke Wang, Xinyuan Chen +1Audio-Video GenerationVideo Generation

  6. LongCat-Video-Avatar 1.5 Technical Report

    May 26, 2026Meituan LongCat Team, Xunliang Cai, Meng Cheng +10Audio-Video GenerationLong Video Generation

  7. Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation

    May 24, 2026Shuyuan Tu, Qi Tian, Zihan Yang +9Cross-Modal LearningAudio-Video Generation

  8. AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models

    May 23, 2026Jialiang Yang, Bin Xia, Ruihang Chu +6Audio-Video GenerationAudio-Visual Alignment

  9. MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

    May 19, 2026Yujie Wei, Yujin Han, Zhekai Chen +20Audio-Video GenerationAudio-Visual Alignment

  10. WavFlow: Audio Generation in Waveform Space

    May 18, 2026Feiyan Zhou, Luyuan Wang, Shoufa Chen +6Text-to-Audio GenerationAudio-Video Generation

  11. InstructAV2AV: Instruction-Guided Audio-Video Joint Editing

    May 18, 2026Haojie Zheng, Yixin Yang, Siqi Yang +2Audio-Video GenerationVideo Diffusion Models

  12. CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation

    May 18, 2026Gyubin Lee, Junwon Lee, Juhan NamText-to-Audio GenerationAudio-Video Generation

  13. Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

    May 17, 2026Yuheng Chen, Qingdong He, Teng Hu +4Audio-Video GenerationAudio-Visual Synchronization

  14. Sound Sparks Motion: Audio and Text Tuning for Video Editing

    May 14, 2026AmirHossein Naghi Razlighi, Aryan Mikaeili, Ali Mahdavi-Amiri +2Audio-Video GenerationInference-Time Optimization

  15. OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

    May 12, 2026Guohui Zhang, XiaoXiao Ma, Jie Huang +9Audio-Video GenerationAudio-Visual Synchronization

  16. AllocMV: Optimal Resource Allocation for Music Video Generation via Structured Persistent State

    May 11, 2026Huimin Wang, Leilei Ouyang, Chang Xia +3Audio-Video GenerationLong-Horizon Video Generation

  17. Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation

    May 9, 2026Shihao Cheng, Jiaxu Zhang, Quanyue Song +6Audio-Video GenerationAudio-Visual Synchronization

  18. Do Joint Audio-Video Generation Models Understand Physics?

    May 8, 2026Zijun Cui, Xiulong Liu, Hao Fang +8Physical Consistency in Video GenerationAudio-Video Generation

  19. Audio-Visual Intelligence in Large Foundation Models

    May 5, 2026You Qin, Kai Liu, Shengqiong Wu +12Audio-Visual UnderstandingAudio-Video Generation

  20. MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video

    May 1, 2026Kazuya Tateishi, Akira Takahashi, Atsuo Hiroe +3Audio-Video GenerationSound Event Detection

  21. Generate Your Talking Avatar from Video Reference

    Apr 30, 2026Zujin Guo, Zhenhui Ye, Yi Ren +4Video-Reference Video GenerationAudio-Video Generation

  22. Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation

    Apr 28, 2026Yupeng Zhou, Lianghua Huang, Zhifan Wu +7Audio-Video GenerationLong-Horizon Video Generation

  23. Talking Slide Avatars: Open-Source Multimodal Communication Approach for Teaching

    Apr 26, 2026Xinxing WuAudio-Video GenerationEducational Technology

  24. Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

    Apr 26, 2026Chunyu Li, Jiaye Li, Ruiqiao Mei +4Audio-Video GenerationVideo Diffusion Models