cs.CVSep 28, 2026

Joint and Cross-Modal Video-Audio Generation and Editing: A Unified Formulation and Design Taxonomy

Authors: Abhinav Sharma, Sai Karthik Navuluru, Wang Wei, Daksh Dangi, Xiangbo Gao, Li Li, Bo Ni, Vardhan Dongre, +16 more

Organizations: University of Massachusetts Amherst · University of Texas at Dallas · Virginia Tech · Texas A&M University · University of Southern California · Vanderbilt University · University of Illinois Urbana-Champaign · Adobe Research · Arizona State University · University of Oregon · Stanford University · Dolby Laboratories · Cisco

Abstract

Video and audio are perceived together, yet most generative models treat them in isolation. We examine methods that model the two modalities jointly, generate one from the other, or edit them in a coupled manner, organized around a single question: how is the output kept coherent across modalities in time and semantics? A unified formulation casts joint generation, cross-modal generation, and joint editing as three problems defined on a single distribution over audio-visual pairs, and a taxonomy compares methods along five design axes. To our knowledge, this is the first overview to systematically taxonomize joint audio-visual editing, which we map as nine edit categories spanning 28 edit types. We describe methods, datasets, and metrics for each setting and close with the open problems we view as most consequential.

Figures & tables

Appendix figures & tables7 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing

    May 24, 2026Sen Liang, Cong Wang, Fengbin Guan +6Audio-Visual ConsistencyAudio-Video Generation

  2. OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

    Jul 26, 2026Jun Zhan, Chen Yang, Yitian Gong +23Audio-Video GenerationCross-Modal Alignment

  3. Soundwich: Video Generation with Layered and Controllable Audio

    Sep 30, 2026Zhuo Ning, AmirHossein Naghi Razlighi, Sagi Polaczek +2Audio-Video GenerationVideo Generation