Audio-Video Generation

Latest papers 87

All topics
CardsList
  1. Prism: Dynamic Sparse Attention for Native 2K Joint Video-Audio Generation Model Training

    Oct 4, 2026Shuyuan Tu, Qi Tian, Yinming Huang +8Audio-Video GenerationSpatio-Temporal Attention

  2. Soundwich: Video Generation with Layered and Controllable Audio

    Sep 30, 2026Zhuo Ning, AmirHossein Naghi Razlighi, Sagi Polaczek +2Audio-Video GenerationVideo Generation

  3. Here the World in Stereo: Learning Dynamic Spatial Correspondence for Immersive Joint Video-Audio Generation

    Sep 30, 2026Hanmo Chen, Chengcheng Liu, Tianxiao Chen +7Audio-Visual ConsistencyAudio-Video Generation

  4. Salt++: Context-Aligned Post-Training for Few-Step Streaming Multimodal Generation

    Sep 29, 2026Xingtong Ge, Yutong Wang, Lunjie Zhu +7Audio-Video GenerationFew-Step Generation

  5. EvolvingAvatar: Interactive 3D Head Generation That Adapts as Conversations Unfold

    Sep 28, 2026Junjie Chen, Fei Wang, Kun Li +5AvatarsAudio-Video Generation

  6. ORAV: Benchmarking Audio-Video Generation from Multimodal Contexts

    Sep 28, 2026Jiacheng Hua, Xiaokun Feng, Jiaqi Hua +3Audio-Video GenerationMultimodal Generation

  7. Joint and Cross-Modal Video-Audio Generation and Editing: A Unified Formulation and Design Taxonomy

    Sep 28, 2026Abhinav Sharma, Sai Karthik Navuluru, Wang Wei +21Audio-Video GenerationAudio-Visual Consistency

  8. AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation

    Sep 24, 2026Zhiyu Xu, Weilong Yan, Yufei Shi +4Audio-Video GenerationDiffusion-Based Reinforcement Learning Methods

  9. Beyond Coherence: Benchmarking Professional Editing-Technique Execution in Multi-Shot Audio-Video Generation

    Sep 8, 2026Tianyi Zeng, Junchao Liao, Yujie Wei +9Video EditingAudio-Video Generation

  10. The Attention Triangle in Audio-Video Models

    Sep 3, 2026Sagi Polaczek, Noa Kraicer, Gal Metzer +4Cross-Modal AttentionAudio-Video Generation

  11. DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

    Aug 31, 2026Jiashu Zhu, Yanhao Zheng, Ruitian Tian +7Audio-Video GenerationMultimodal Generation

  12. TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation

    Aug 25, 2026Xiaoda Yang, Yuxiang Liu, Kaiwen Zheng +12Audio-Video GenerationText-To-Video Generation Model

  13. VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

    Aug 19, 2026Yinming Huang, Shuyuan Tu, Xi Yan +6Audio-Video GenerationPreference Datasets

  14. Intervention, Not Shared Latents: Blocking Visual Shortcuts in Audio-Video Generation

    Aug 14, 2026Jian Xu, Delu Zeng, John PaisleyAudio-Video GenerationShortcut Learning

  15. StrAD: A Streaming Method and Benchmark for Audio Description Generation for Long-form Videos

    Aug 12, 2026Julian Spravil, Sebastian Houben, Sven BehnkeAudio-Video GenerationAudio Understanding

  16. HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion

    Aug 12, 2026Wenshuo Peng, Kaipeng ZhangAudio-Video GenerationHarmonization

  17. UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

    Aug 12, 2026Yuxuan Zhang, Haozhong Xiong, Jiayi Song +5Audio-Video GenerationStreaming

  18. Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections

    Aug 12, 2026Haven Kim, Zachary Novack, Julian McAuley +1Audio-Video GenerationFilms

  19. Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework

    Aug 10, 2026Dongxu Ge, Shansong Liu, Cheng Gong +3Audio-Video GenerationMultimodal Generation

  20. MMAG: A Multi-Control Mixed Audio Generation Benchmark

    Aug 7, 2026Zihao Zheng, Xuenan Xu, Jiahao Mei +5Modern Generative Audio ModelsAudio-Video Generation

  21. Vorch-Director: Interactive World Story Model via Noise-Aware Error Rectification

    Aug 6, 2026Lisai Zhang, Yidi Wu, Qi Liu +7Audio-Video GenerationDramadirector

  22. Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

    Aug 6, 2026Menglin Han, Yang Ding, Yulei Lu +6Audio-Video GenerationStreaming

  23. Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

    Aug 5, 2026Zehua Chen, Junyou Wang, Yuxuan Jiang +5Audio-Video GenerationText-To-Video Diffusion Models

  24. OmniVR: Audio-Video Conditional Generation for Archival Footage Restoration

    Aug 4, 2026Xin Lu, Zihao Fan, Jie Huang +4Video RestorationAudio-Video Generation

  25. EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

    Aug 3, 2026Jiayu Chen, Xiaoyu Wu, Rongshan Gao +6Audio-Video GenerationAudio-Visual Consistency

  26. AcoustiTrace: When Plausible Sound Violates Physics

    Aug 3, 2026Shiyang Li, Yuewen Cao, Yihao Liu +4Audio-Video GenerationAcoustic

  27. StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring

    Aug 3, 2026Xiangyue Zhang, Jianfang Li, Jiaxu Zhang +2Co-Speech Gesture GenerationAudio-Video Generation

  28. Ripple: Real-Time Streaming Audio-Video Generation With Cross-Modal Recurrent Memory

    Jul 29, 2026Yanbo Ding, Zhizhi Guo, Quanyue Song +4Audio-Video GenerationReal-Time Systems

  29. TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation

    Jul 27, 2026Qijun Gan, Chenwei Zhang, Meiguang Jin +2Audio-Video GenerationReal-Time Systems

  30. AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars

    Jul 27, 2026Hengyuan Zhang, Jingna Sun, Meiguang Jin +1Audio-Video GenerationVideo Generation

  31. OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

    Jul 26, 2026Jun Zhan, Chen Yang, Yitian Gong +23Audio-Video GenerationCross-Modal Alignment

  32. OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars

    Jul 25, 2026Quanyue Song, Yishan He, Yanbo Ding +4Audio-Video GenerationAudio-Visual Consistency

  33. MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

    Jul 15, 2026Xiaohan Zhang, Yuqing Wen, Junlin Chen +9Audio-Video GenerationAudio-Visual Consistency

  34. Bring Music The Horizon: Music-Driven 360∘^\circ Video Generation

    Jul 15, 2026Kai Hsu Tsai, Yong Wei Fu, Hung I Yang +1Dance-To-Music GenerationAudio-Video Generation

  35. Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space

    Jul 7, 2026Thanh V. T. Tran, Ngoc-Son Nguyen, Luong Tran +4Audio-Video GenerationCross-Modal Alignment

  36. Lights, Camera, Carbon: Architectural Scaling Laws for Video Generation Energy Consumption

    Jul 5, 2026Nidhal Jegham, Boris Gamazaychikov, Sasha LuccioniVideo Diffusion ModelsVideo Generation

  37. Conversational Human Audio-visual Talking Dialogue Generation

    Jul 2, 2026Junhao Song, Lluis Guasch, Xilin He +8Conversational DatasetsAudio-Video Generation

  38. AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

    Jun 29, 2026Kien T. Pham, I Chieh Chen, Qifeng Chen +1Audio-Video GenerationAudio Tokenizers

  39. FacePlex: Toward Natural Full-Duplex Conversational Avatars

    Jun 29, 2026Habin Lim, Hah Min Lew, Jae-Ho Lee +4Precise Lip SynchronizationFull-Duplex Speech Models

  40. MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control

    Jun 28, 2026Kaiqi Liu, Yunyao Mao, Ziqi Cai +8Audio-Video GenerationNarratives

  41. Integrating Facial Generation into Full-Duplex Spoken Dialogue Systems

    Jun 20, 2026Jingjing Jiang, Atsumoto Ohashi, Ryuichiro HigashinakaFull-Duplex Speech ModelsAudio-Video Generation

  42. UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating

    Jun 19, 2026Jiehui Huang, Yuechen Zhang, Bin Xia +7Audio-Video GenerationMotion Coherence

  43. FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

    Jun 12, 2026Shiyao Wang, Xijuan Zeng, Hui Wang +4Audio-Video Generation

  44. CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation

    Jun 8, 2026Yuheng Chen, Teng Hu, Yuji Wang +7Audio-Video GenerationInteractive Video Generation

  45. Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation

    Jun 2, 2026Xuan Wei, Jiahui Chen, Kaiheng Li +2Human Motion GenerationAudio-Video Generation

  46. Inference-Time Scaling for Joint Audio-Video Generation

    Jun 2, 2026Jaemin Jung, Kyeongha Rho, Inkyu Shin +1Audio-Video GenerationPerceptual Quality

  47. Benchmarking Single-Factor Physical Video-to-Audio Generation

    May 28, 2026Tingle Li, Siddharth Gururani, Kevin J. Shih +6Audio-Video Generation

  48. Native Audio-Visual Alignment for Generation

    May 28, 2026Longbin Ji, Guan Wang, Xuan Wei +6Audio-Video GenerationAudio-Visual Consistency

  49. MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation

    May 27, 2026Haitian Li, Yanghao Zhou, Heyan Huang +15Audio-Video GenerationAudio-Visual Consistency

  50. LongCat-Video-Avatar 1.5 Technical Report

    May 26, 2026Meituan LongCat Team, Xunliang Cai, Meng Cheng +10Audio-Video GenerationVisual Fidelity

  51. LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

    May 25, 2026Tengfei Liu, Yang Shi, Xuanyu Zhu +17Audio-Video GenerationAudio-Visual Consistency

  52. Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation

    May 25, 2026Zhicheng Zhang, Lei Wang, Yu Zhang +1Audio-Video GenerationGenerative Video Models