cs.AIAug 27, 2026

Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation

Authors: Kaichao Jiang, Changtao Miao, Baiqi Wu, Zhiyuan Lu, Kang Yang, Peiwei Zhao, Junchi Chen, Yunfeng Diao, +3 more

Organizations: University of Science and Technology of China · Independent Researcher · Zhejiang University · Hefei University of Technology

Abstract

Recent audio-video generators increasingly support joint conditioning on text, images, audio, and video. These capabilities also enable attacks that exploit cross-modal interactions or obscure harmful intent to bypass safeguards and induce harmful audio-video outputs. However, existing generation-safety benchmarks have not kept pace with these advances, providing limited coverage of multimodal input combinations and obscured attack intents. To address these gaps, we introduce Multi2AV-Safety, the first full-coverage red-team benchmark for multimodal-to-audio-video generation, comprising 11,024 attack instances across all 11 non-singleton T/I/A/V conditioning configurations, 4 attack-intent categories, and 5 harm categories. Our evaluation of recent state-of-the-art models, including four multimodal-conditioned audio-video generators and eight safety guards, reveals substantial vulnerabilities in both generation and safeguarding, with multimodal compositional risk and obscured attack-intent risk emerging as two complementary challenges. Guided by these findings, we introduce PerceptGuard, an omni-modal guard integrating compositional-risk and attack-intent supervision through structured risk perception learning. By jointly training rationale generation and safety classification, it learns shared risk representations that enable a safety head to make efficient predictions at inference without rationale decoding, while retaining the ability to generate explanations on demand. Across 34 safety benchmarks, PerceptGuard combines SOTA multimodal safety detection with highly competitive unimodal performance, strengthening input-side safeguards against multimodal attacks on omni models. In particular, it improves safeguarding against the above risks, achieving an overall recall of 86.06% on Multi2AV-Safety and outperforming GuardReasoner-Omni by 14.56%.

Figures & tables

Appendix figures & tables4 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. The Price of Consistency: Exploiting Visual Anchors for Multimodal Jailbreaking in Video Generation

    Sep 7, 2026Peng Li, Qianqian Xu, Yangbangyan Jiang +2Image-to-Video GenerationMultimodal Jailbreak Attacks

  2. VPA-Guard: Defending and Benchmarking Image-to-Video Generation Against Visual Prompt Attacks

    Jun 24, 2026Yining Sun, Haoyu Kang, Jiajun Wu +7Image-to-Video GenerationVideo Generation

  3. SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation

    May 31, 2026Yingzi Ma, Xiaogeng Liu, Yawen Zheng +1Image-to-Video GenerationText-to-Video Generation