Jailbreak Attacks

Latest papers 48

All topics
CardsList
  1. Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking

    May 9, 2026Zhida He, Xiaoyu Wen, Han Qi +7RL for Language ModelsCredit Assignment in RL

  2. Mitigating Many-shot Jailbreak Attacks with One Single Demonstration

    May 8, 2026Kejia Chen, Jiawen Zhang, Boheng Li +6Jailbreak AttacksIn-Context Learning

  3. Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs

    May 7, 2026Md Farhamdur Reza, Richeng Jin, Tianfu Wu +1Multimodal Large Language ModelsJailbreak Attacks

  4. ContextualJailbreak: Evolutionary Red-Teaming via Simulated Conversational Priming

    May 4, 2026Mario Rodríguez Béjar, Francisco J. Cortés-Delgado, S. Braghin +1Evolutionary OptimizationLLM Red Teaming

  5. MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

    May 3, 2026Jialin Song, Xiaodong Liu, Weiwei Yang +4LLM Safety BenchmarksAdversarial Prompt Generation

  6. TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning

    Apr 30, 2026Bowen Sun, Chaozhuo Li, Yaodong Yang +2Jailbreak AttacksLLM Security

  7. Adaptive Prompt Embedding Optimization for LLM Jailbreaking

    Apr 27, 2026Miles Q. Li, Benjamin C. M. Fung, Boyang Li +2Adversarial Prompt GenerationAdversarial Attacks on LLMs

  8. Jailbreaking Frontier Foundation Models Through Intention Deception

    Apr 27, 2026Xinhe Wang, Katia Sycara, Yaqi XieJailbreak AttacksLLM Safety

  9. Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety

    Apr 20, 2026Marcello Galisai, Susanna Cifani, Francesco Giarrusso +5LLM Safety BenchmarksAdversarial Attacks on LLMs

  10. Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing

    Apr 17, 2026Zehao Wang, Lanjun WangAdversarial Prompt GenerationJailbreak Attacks

  11. When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models

    Feb 10, 2026Jiacheng Hou, Yining Sun, Ruochong Jin +4Jailbreak AttacksMultimodal Jailbreak Attacks

  12. NonTextual Target Attack

    Oct 3, 2025Xinzhe Huang, Wenjing Hu, Tianhang Zheng +6Adversarial Prompt GenerationAdversarial Attacks on LLMs

  13. HauntAttack: When Attack Follows Reasoning as a Shadow

    Jun 8, 2025Jingyuan Ma, Rui Li, Zheng Li +4Adversarial Attacks on LLMsJailbreak Attacks

  14. The Linear Geometry of Interpretable Tokens: Jailbreaking Attacks and Defenses for Unlearned Diffusion Models

    Apr 30, 2025Siyi Chen, Yimeng Zhang, Sijia Liu +1Jailbreak AttacksDiffusion Model Unlearning