Multimodal Jailbreak Attacks

Momentum

2 papers in the last four weeks, against 2 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 18

All topics
CardsList
  1. SceneJail: Exploiting Video Scenario Context to Jailbreak Multimodal LLMs

    Sep 30, 2026Wenyu Chen, Li Wang, Chuanchao Zang +5VLM RobustnessJailbreak Attacks

  2. The Price of Consistency: Exploiting Visual Anchors for Multimodal Jailbreaking in Video Generation

    Sep 7, 2026Peng Li, Qianqian Xu, Yangbangyan Jiang +2Image-to-Video GenerationMultimodal Jailbreak Attacks

  3. Jailbreaking Text-to-Image Models Through Cracks: Navigating Heterogeneous Safety Filters via Multi-Agent Debate

    Sep 1, 2026Kaiyan Wen, Shijie Zhang, Lu Yu +1Adversarial Attacks on VLMsMulti-Agent Debate

  4. Fully Unleashing the Multimodal Attacker: Meta-Adaptive Jailbreaking of Vision-Language Models

    Aug 27, 2026Benlei Cui, Shen Pang, Yuke Wang +7VLM RobustnessAdversarial Attacks on VLMs

  5. Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems

    Aug 2, 2026Wanguang Li, Zhaoxin Wang, Handing WangAdversarial Prompt GenerationT2I Generation

  6. PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation

    Jun 23, 2026Leyi Sheng, Han Sun, Zhen Sun +4AI Safety EvaluationMultimodal Jailbreak Attacks

  7. Jailbreaking Multimodal Large Language Models using Multi-Clip Video

    Jun 1, 2026Choongwon Kang, Seungjong Sun, Hyunmin Jun +1Multimodal RobustnessVideo-Language Models

  8. When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?

    May 27, 2026Yuan Tian, Bing Hu, Fang Wu +3VLM RobustnessTool Use in VLMs

  9. DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs

    May 18, 2026Wenzhuo Xu, Zhipeng Wei, Zonghao Ying +4Multimodal Large Language ModelsLLM Safety

  10. Break the Brake, Not the Wheel: Untargeted Jailbreak via Entropy Maximization

    May 11, 2026Mengqi He, Xinyu Tian, Xin Shen +6Adversarial Attacks on VLMsAdversarial Attacks

  11. OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing

    May 8, 2026Jianming Chen, Yawen Wang, Junjie Wang +3Adversarial Prompt GenerationT2I Generation

  12. Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs

    May 7, 2026Md Farhamdur Reza, Richeng Jin, Tianfu Wu +1Multimodal Large Language ModelsJailbreak Attacks

  13. On Optimizing Multimodal Jailbreaks for Spoken Language Models

    Mar 19, 2026Aravind Krishnan, Karolina Stańczak, Dietrich KlakowAdversarial AttacksLLM Jailbreak Attacks

  14. When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models

    Feb 10, 2026Jiacheng Hou, Yining Sun, Ruochong Jin +4Jailbreak AttacksMultimodal Jailbreak Attacks

  15. Robustness of Vision Language Models Against Split-Image Harmful Input Attacks

    Feb 8, 2026Md Rafi Ur Rashid, MD Sadik Hossain Shanto, Vishnu Asutosh Dasu +1VLM RobustnessAdversarial Attacks on VLMs

  16. Divide and Conquer: A Hybrid Strategy Defeats Multimodal Large Language Models

    Dec 21, 2024Yanxu Mao, Peipei Liu, Tiehan Cui +3Adversarial Attacks on LLMsMultimodal Large Language Models