Audio-Video Generation

Latest papers 101

All topics
CardsList
  1. Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

    Aug 5, 2026Zehua Chen, Junyou Wang, Yuxuan Jiang +5Audio-Video GenerationAudio Diffusion Models

  2. EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

    Aug 3, 2026Jiayu Chen, Xiaoyu Wu, Rongshan Gao +6Audio-Video GenerationAudio-Visual Alignment

  3. AcoustiTrace: When Plausible Sound Violates Physics

    Aug 3, 2026Shiyang Li, Yuewen Cao, Yihao Liu +4Physical Consistency in Video GenerationAudio-Video Generation

  4. LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

    Jul 29, 2026Rongxiang Zhang, Songhua LiuAudio-Video GenerationDiffusion Model Distillation

  5. Ripple: Real-Time Streaming Audio-Video Generation With Cross-Modal Recurrent Memory

    Jul 29, 2026Yanbo Ding, Zhizhi Guo, Quanyue Song +4Audio-Video GenerationLong Video Generation

  6. OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

    Jul 26, 2026Jun Zhan, Chen Yang, Yitian Gong +23Variational AutoencodersAudio-Video Generation

  7. OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars

    Jul 25, 2026Quanyue Song, Yishan He, Yanbo Ding +4Audio-Video GenerationReal-Time Interactive Video Generation

  8. MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

    Jul 15, 2026Xiaohan Zhang, Yuqing Wen, Junlin Chen +9Audio-Video GenerationAudio-Visual Alignment

  9. Bring Music The Horizon: Music-Driven 360∘^\circ Video Generation

    Jul 15, 2026Kai Hsu Tsai, Yong Wei Fu, Hung I Yang +1Audio-Video Generation

  10. Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

    Jul 10, 2026Yijie Qian, Juncheng Wang, Chao Xu +6Audio-Video GenerationGroup Relative Policy Optimization

  11. Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space

    Jul 7, 2026Thanh V. T. Tran, Ngoc-Son Nguyen, Luong Tran +4Audio-Video GenerationAudio-Visual Synchronization

  12. Wan-Streamer v0.2: Higher Resolution, Same Latency

    Jul 5, 2026Lianghua Huang, Zhi-Fan Wu, Yupeng Shi +23Audio-Video GenerationReal-Time Interactive Video Generation

  13. Conversational Human Audio-visual Talking Dialogue Generation

    Jul 2, 2026Junhao Song, Lluis Guasch, Xilin He +8Audio-Video GenerationSpoken Dialogue Systems

  14. Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation

    Jun 30, 2026Baiqin Wang, Sen Chen, Jiankuo Zhao +3Audio-Video GenerationTalking Head Generation

  15. AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

    Jun 29, 2026Kien T. Pham, I Chieh Chen, Qifeng Chen +1Audio-Video GenerationAudio-Visual Alignment

  16. FacePlex: Toward Natural Full-Duplex Conversational Avatars

    Jun 29, 2026Habin Lim, Hah Min Lew, Jae-Ho Lee +4Audio-Video GenerationTalking Head Generation

  17. OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data

    Jun 29, 2026Kaixing Yang, Jiashu Zhu, Xulong Tang +8Audio-Video GenerationMultimodal Generation

  18. MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control

    Jun 28, 2026Kaiqi Liu, Yunyao Mao, Ziqi Cai +8Audio-Video GenerationAudio-Visual Alignment

  19. UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating

    Jun 19, 2026Jiehui Huang, Yuechen Zhang, Bin Xia +7Audio-Video GenerationMemory-Augmented Video Generation

  20. FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

    Jun 12, 2026Shiyao Wang, Xijuan Zeng, Hui Wang +4Audio-Video GenerationAudio-Visual Synchronization

  21. ReFree: Towards Realistic Co-Speech Video Generation via Reward-Free RL and Multilevel Speech Guidance

    Jun 11, 2026Salaheldin Mohamed, M. Hamza Mughal, Rishabh Dabral +1Audio-Video GenerationRL for Video Generation

  22. CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation

    Jun 8, 2026Yuheng Chen, Teng Hu, Yuji Wang +7Audio-Video GenerationText-to-Video Generation

  23. Resonant Minds: Closed-Loop Social Avatars with Theory of Mind

    Jun 4, 2026Jianxu Shangguan, Jing Xu, Hang Ye +4Audio-Video GenerationTheory of Mind

  24. Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation

    Jun 2, 2026Ye Tao, Lupeng Liu, Xuenan Xu +6Audio-Video GenerationUnified Multimodal Models

  25. Inference-Time Scaling for Joint Audio-Video Generation

    Jun 2, 2026Jaemin Jung, Kyeongha Rho, Inkyu Shin +1Audio-Video GenerationInference-Time Scaling