Audio-Video Generation

Latest papers 99

All topics
CardsList
  1. WorldSonus: Bringing Sound to Worlds

    Oct 6, 2026Pengjun Fang, Jingyi Fa, Kam Man Wu +9Audio-Video GenerationAudio Diffusion Models

  2. UltraDub: Towards Authentic Dubbing by Unifying Visually-Steered Flow Learning and Trajectory Guidance

    Oct 5, 2026Gaoxiang Cong, Liang Li, Jianwei Wen +3Audio-Video GenerationAudio-Visual Alignment

  3. Prism: Dynamic Sparse Attention for Native 2K Joint Video-Audio Generation Model Training

    Oct 4, 2026Shuyuan Tu, Qi Tian, Yinming Huang +8Audio-Video GenerationVideo Generation

  4. Soundwich: Video Generation with Layered and Controllable Audio

    Sep 30, 2026Zhuo Ning, AmirHossein Naghi Razlighi, Sagi Polaczek +2Audio-Video GenerationAudio-Visual Synchronization

  5. PLACE: Positional Latent Adaptation via Conditioned Embeddings for Binaural Audio Generation

    Sep 30, 2026Tiernon Riesenmy, You Zhang, Gautam Bhattacharya +1Text-to-Audio GenerationAudio-Video Generation

  6. Here the World in Stereo: Learning Dynamic Spatial Correspondence for Immersive Joint Video-Audio Generation

    Sep 30, 2026Hanmo Chen, Chengcheng Liu, Tianxiao Chen +7Audio-Video GenerationAudio-Visual Alignment

  7. Salt++: Context-Aligned Post-Training for Few-Step Streaming Multimodal Generation

    Sep 29, 2026Xingtong Ge, Yutong Wang, Lunjie Zhu +7Audio-Video GenerationVideo Diffusion Models

  8. AVIO: Learning to Add and Remove Sounding Objects in Audiovisual Scenes

    Sep 29, 2026Weihan Xu, Kan Jen Cheng, Koichi Saito +8Audio-Video GenerationAudio Editing

  9. Enabling Immersive Audio-Visual Experience from Any Video

    Sep 28, 2026Zitong Lan, Mutian Tong, Jiatao Gu +1Audio-Video GenerationAudio-Visual Alignment

  10. ORAV: Benchmarking Audio-Video Generation from Multimodal Contexts

    Sep 28, 2026Jiacheng Hua, Xiaokun Feng, Jiaqi Hua +3Audio-Video GenerationControllable Video Generation

  11. Joint and Cross-Modal Video-Audio Generation and Editing: A Unified Formulation and Design Taxonomy

    Sep 28, 2026Abhinav Sharma, Sai Karthik Navuluru, Wang Wei +21Audio-Video GenerationMultimodal Generation

  12. Video-to-Music Generation for Gameplay Videos

    Sep 25, 2026Felipe Marra, Lucas N. FerreiraAudio-Video GenerationMusic Generation

  13. AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation

    Sep 24, 2026Zhiyu Xu, Weilong Yan, Yufei Shi +4Audio-Video GenerationAudio-Visual Alignment

  14. Decoupled Self-Forcing Distillation for Streaming Talking Head Generation

    Sep 9, 2026Yanru An, Ruiyan Wang, Wenwu Wei +7Audio-Video GenerationDiffusion Model Distillation

  15. Beyond Coherence: Benchmarking Professional Editing-Technique Execution in Multi-Shot Audio-Video Generation

    Sep 8, 2026Tianyi Zeng, Junchao Liao, Yujie Wei +9Video Editing BenchmarksAudio-Video Generation

  16. The Attention Triangle in Audio-Video Models

    Sep 3, 2026Sagi Polaczek, Noa Kraicer, Gal Metzer +4Audio-Video GenerationAttention Control in Diffusion Models

  17. DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

    Aug 31, 2026Jiashu Zhu, Yanhao Zheng, Ruitian Tian +7Audio-Video GenerationVideo Diffusion Models

  18. TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation

    Aug 25, 2026Xiaoda Yang, Yuxiang Liu, Kaiwen Zheng +12Audio-Video GenerationDiffusion Model Distillation

  19. VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

    Aug 19, 2026Yinming Huang, Shuyuan Tu, Xi Yan +6Reward ModelingAudio-Video Generation

  20. Intervention, Not Shared Latents: Blocking Visual Shortcuts in Audio-Video Generation

    Aug 14, 2026Jian Xu, Delu Zeng, John PaisleyAudio-Video GenerationCausal Inference

  21. Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars

    Aug 12, 2026Ruibin Li, Tao Yang, Zhiyuan Ma +3Audio-Video GenerationReal-Time Interactive Video Generation

  22. HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion

    Aug 12, 2026Wenshuo Peng, Kaipeng ZhangAudio-Video GenerationAudio Diffusion Models

  23. UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

    Aug 12, 2026Yuxuan Zhang, Haozhong Xiong, Jiayi Song +5Audio-Video GenerationVideo Diffusion Models

  24. Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections

    Aug 12, 2026Haven Kim, Zachary Novack, Julian McAuley +1Audio-Video GenerationMusic Generation

  25. Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence

    Aug 11, 2026Haoyu Zhang, Zhipeng Li, Xiaoying Tang +2Audio-Video GenerationStreaming Video Generation

  26. Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

    Aug 5, 2026Zehua Chen, Junyou Wang, Yuxuan Jiang +5Audio-Video GenerationAudio Diffusion Models

  27. EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

    Aug 3, 2026Jiayu Chen, Xiaoyu Wu, Rongshan Gao +6Audio-Video GenerationAudio-Visual Alignment

  28. AcoustiTrace: When Plausible Sound Violates Physics

    Aug 3, 2026Shiyang Li, Yuewen Cao, Yihao Liu +4Physical Consistency in Video GenerationAudio-Video Generation

  29. LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

    Jul 29, 2026Rongxiang Zhang, Songhua LiuAudio-Video GenerationDiffusion Model Distillation

  30. Ripple: Real-Time Streaming Audio-Video Generation With Cross-Modal Recurrent Memory

    Jul 29, 2026Yanbo Ding, Zhizhi Guo, Quanyue Song +4Audio-Video GenerationLong Video Generation

  31. OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

    Jul 26, 2026Jun Zhan, Chen Yang, Yitian Gong +23Variational AutoencodersAudio-Video Generation

  32. OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars

    Jul 25, 2026Quanyue Song, Yishan He, Yanbo Ding +4Audio-Video GenerationReal-Time Interactive Video Generation

  33. MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

    Jul 15, 2026Xiaohan Zhang, Yuqing Wen, Junlin Chen +9Audio-Video GenerationAudio-Visual Alignment

  34. Bring Music The Horizon: Music-Driven 360∘^\circ Video Generation

    Jul 15, 2026Kai Hsu Tsai, Yong Wei Fu, Hung I Yang +1Audio-Video Generation

  35. Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

    Jul 10, 2026Yijie Qian, Juncheng Wang, Chao Xu +6Audio-Video GenerationGroup Relative Policy Optimization

  36. Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space

    Jul 7, 2026Thanh V. T. Tran, Ngoc-Son Nguyen, Luong Tran +4Audio-Video GenerationAudio-Visual Synchronization

  37. Wan-Streamer v0.2: Higher Resolution, Same Latency

    Jul 5, 2026Lianghua Huang, Zhi-Fan Wu, Yupeng Shi +23Audio-Video GenerationReal-Time Interactive Video Generation

  38. Conversational Human Audio-visual Talking Dialogue Generation

    Jul 2, 2026Junhao Song, Lluis Guasch, Xilin He +8Audio-Video GenerationSpoken Dialogue Systems

  39. Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation

    Jun 30, 2026Baiqin Wang, Sen Chen, Jiankuo Zhao +3Audio-Video GenerationTalking Head Generation

  40. AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

    Jun 29, 2026Kien T. Pham, I Chieh Chen, Qifeng Chen +1Audio-Video GenerationAudio-Visual Alignment

  41. FacePlex: Toward Natural Full-Duplex Conversational Avatars

    Jun 29, 2026Habin Lim, Hah Min Lew, Jae-Ho Lee +4Audio-Video GenerationTalking Head Generation

  42. OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data

    Jun 29, 2026Kaixing Yang, Jiashu Zhu, Xulong Tang +8Audio-Video GenerationMultimodal Generation

  43. MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control

    Jun 28, 2026Kaiqi Liu, Yunyao Mao, Ziqi Cai +8Audio-Video GenerationAudio-Visual Alignment

  44. UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating

    Jun 19, 2026Jiehui Huang, Yuechen Zhang, Bin Xia +7Audio-Video GenerationMemory-Augmented Video Generation

  45. FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

    Jun 12, 2026Shiyao Wang, Xijuan Zeng, Hui Wang +4Audio-Video GenerationAudio-Visual Synchronization

  46. ReFree: Towards Realistic Co-Speech Video Generation via Reward-Free RL and Multilevel Speech Guidance

    Jun 11, 2026Salaheldin Mohamed, M. Hamza Mughal, Rishabh Dabral +1Audio-Video GenerationRL for Video Generation

  47. CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation

    Jun 8, 2026Yuheng Chen, Teng Hu, Yuji Wang +7Audio-Video GenerationText-to-Video Generation

  48. Resonant Minds: Closed-Loop Social Avatars with Theory of Mind

    Jun 4, 2026Jianxu Shangguan, Jing Xu, Hang Ye +4Audio-Video GenerationTheory of Mind

  49. Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation

    Jun 2, 2026Ye Tao, Lupeng Liu, Xuenan Xu +6Audio-Video GenerationUnified Multimodal Models

  50. Inference-Time Scaling for Joint Audio-Video Generation

    Jun 2, 2026Jaemin Jung, Kyeongha Rho, Inkyu Shin +1Audio-Video GenerationInference-Time Scaling