Audio-Video Generation

Latest papers 101

All topics
CardsList
  1. WorldSonus: Bringing Sound to Worlds

    Oct 6, 2026Pengjun Fang, Jingyi Fa, Kam Man Wu +9Audio-Video GenerationAudio Diffusion Models

  2. UltraDub: Towards Authentic Dubbing by Unifying Visually-Steered Flow Learning and Trajectory Guidance

    Oct 5, 2026Gaoxiang Cong, Liang Li, Jianwei Wen +3Audio-Video GenerationAudio-Visual Alignment

  3. Prism: Dynamic Sparse Attention for Native 2K Joint Video-Audio Generation Model Training

    Oct 4, 2026Shuyuan Tu, Qi Tian, Yinming Huang +8Audio-Video GenerationVideo Generation

  4. Soundwich: Video Generation with Layered and Controllable Audio

    Sep 30, 2026Zhuo Ning, AmirHossein Naghi Razlighi, Sagi Polaczek +2Audio-Video GenerationAudio-Visual Synchronization

  5. PLACE: Positional Latent Adaptation via Conditioned Embeddings for Binaural Audio Generation

    Sep 30, 2026Tiernon Riesenmy, You Zhang, Gautam Bhattacharya +1Text-to-Audio GenerationAudio-Video Generation

  6. Hear the World in Stereo: Learning Dynamic Spatial Correspondence for Immersive Joint Video-Audio Generation

    Sep 30, 2026Hanmo Chen, Chengcheng Liu, Tianxiao Chen +7Audio-Video GenerationAudio-Visual Alignment

  7. Salt++: Context-Aligned Post-Training for Few-Step Streaming Multimodal Generation

    Sep 29, 2026Xingtong Ge, Yutong Wang, Lunjie Zhu +7Audio-Video GenerationVideo Diffusion Models

  8. AVIO: Learning to Add and Remove Sounding Objects in Audiovisual Scenes

    Sep 29, 2026Weihan Xu, Kan Jen Cheng, Koichi Saito +8Audio-Video GenerationAudio Editing

  9. Enabling Immersive Audio-Visual Experience from Any Video

    Sep 28, 2026Zitong Lan, Mutian Tong, Jiatao Gu +1Audio-Video GenerationAudio-Visual Alignment

  10. ORAV: Benchmarking Audio-Video Generation from Multimodal Contexts

    Sep 28, 2026Jiacheng Hua, Xiaokun Feng, Jiaqi Hua +3Audio-Video GenerationControllable Video Generation

  11. Joint and Cross-Modal Video-Audio Generation and Editing: A Unified Formulation and Design Taxonomy

    Sep 28, 2026Abhinav Sharma, Sai Karthik Navuluru, Wang Wei +21Audio-Video GenerationMultimodal Generation

  12. Video-to-Music Generation for Gameplay Videos

    Sep 25, 2026Felipe Marra, Lucas N. FerreiraAudio-Video GenerationMusic Generation

  13. AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation

    Sep 24, 2026Zhiyu Xu, Weilong Yan, Yufei Shi +4Audio-Video GenerationAudio-Visual Alignment

  14. Decoupled Self-Forcing Distillation for Streaming Talking Head Generation

    Sep 9, 2026Yanru An, Ruiyan Wang, Wenwu Wei +7Audio-Video GenerationDiffusion Model Distillation

  15. Beyond Coherence: Benchmarking Professional Editing-Technique Execution in Multi-Shot Audio-Video Generation

    Sep 8, 2026Tianyi Zeng, Junchao Liao, Yujie Wei +9Video Editing BenchmarksAudio-Video Generation

  16. The Attention Triangle in Audio-Video Models

    Sep 3, 2026Sagi Polaczek, Noa Kraicer, Gal Metzer +4Audio-Video GenerationAttention Control in Diffusion Models

  17. DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

    Aug 31, 2026Jiashu Zhu, Yanhao Zheng, Ruitian Tian +7Audio-Video GenerationVideo Diffusion Models

  18. TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation

    Aug 25, 2026Xiaoda Yang, Yuxiang Liu, Kaiwen Zheng +12Audio-Video GenerationDiffusion Model Distillation

  19. VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

    Aug 19, 2026Yinming Huang, Shuyuan Tu, Xi Yan +6Reward ModelingAudio-Video Generation

  20. Intervention, Not Shared Latents: Blocking Visual Shortcuts in Audio-Video Generation

    Aug 14, 2026Jian Xu, Delu Zeng, John PaisleyAudio-Video GenerationCausal Inference

  21. Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars

    Aug 12, 2026Ruibin Li, Tao Yang, Zhiyuan Ma +3Audio-Video GenerationReal-Time Interactive Video Generation

  22. HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion

    Aug 12, 2026Wenshuo Peng, Kaipeng ZhangAudio-Video GenerationAudio Diffusion Models

  23. UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

    Aug 12, 2026Yuxuan Zhang, Haozhong Xiong, Jiayi Song +5Audio-Video GenerationVideo Diffusion Models

  24. Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections

    Aug 12, 2026Haven Kim, Zachary Novack, Julian McAuley +1Audio-Video GenerationMusic Generation

  25. Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence

    Aug 11, 2026Haoyu Zhang, Zhipeng Li, Xiaoying Tang +2Audio-Video GenerationStreaming Video Generation