Jailbreak Attacks

Momentum

13 papers in the last four weeks, up 30% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 154

All topics
CardsList
  1. SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking

    May 1, 2026Jindong Li, Ying Liu, Yali Fu +4Jailbreak AttacksSafety Alignment

  2. Jailbreaking Vision-Language Models Through the Visual Modality

    May 1, 2026Aharon Azulay, Jan Dubiński, Zhuoyun Li +2Large Language Model JailbreaksSafety Alignment

  3. Jailbroken Frontier Models Retain Their Capabilities

    Apr 30, 2026Daniel Zhu, Zihan Wang, Xuchan Bao +1JailbreaksJailbreak Attacks

  4. Attention Is Where You Attack

    Apr 30, 2026Aviral Srivastava, Sourav PandaAdversarial ExamplesJailbreak Attacks

  5. Adaptive Prompt Embedding Optimization for LLM Jailbreaking

    Apr 27, 2026Miles Q. Li, Benjamin C. M. Fung, Boyang Li +2Large Language Model JailbreaksJailbreak Attacks

  6. Evaluating Jailbreaking Vulnerabilities in LLMs Deployed as Assistants for Smart Grid Operations: A Benchmark Against NERC Standards

    Apr 25, 2026Taha Hammadia, Lucas Rea, Ahmad Mohammad Saber +2Large Language Model JailbreaksJailbreak Attacks

  7. AVISE: Framework for Evaluating the Security of AI Systems

    Apr 22, 2026Mikko Lempinen, Joni Kemppainen, Niklas RaesalmiSecurityArtificial Intelligence Evaluation

  8. Breaking Bad: Interpretability-Based Safety Audits of State-of-the-Art LLMs

    Apr 22, 2026Krishiv Agarwal, Ramneet Kaur, Colin Samplawski +6Jailbreak AttacksLlm-As-A-Judge

  9. One Jailbreak, Many Tongues: Learning Language-Insensitive Intention Representations for Multilingual Jailbreak Detection

    Apr 22, 2026Shuyu Jiang, Kaiyu Xu, Xingshu Chen +5Large Language Model JailbreaksMultilingual Safety

  10. EvoJail: Evolutionary Diverse Jailbreak Prompt Generation for Large Language Models

    Apr 22, 2026Rui Tang, Kaiyu Xu, Pengsen Cheng +3Jailbreak AttacksJailbreaks

  11. An Empirical Study of Multi-Generation Sampling for Jailbreak Detection in Large Language Models

    Apr 20, 2026Hanrui Luo, Shreyank N GowdaLarge Language Model JailbreaksJailbreak Attacks

  12. Jailbreaking Large Language Models with Morality Attacks

    Apr 18, 2026Ying Su, Mingen Zheng, Weili Diao +1Large Language Model JailbreaksMoral Reasoning

  13. SafeDream: Safety World Model for Proactive Early Jailbreak Detection

    Apr 18, 2026Bo Yan, Weikai Lin, Yada Zhu +1Jailbreak AttacksJailbreak Success Rates

  14. Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing

    Apr 17, 2026Zehao Wang, Lanjun WangLarge Language Model JailbreaksJailbreak Attacks

  15. On Optimizing Multimodal Jailbreaks for Spoken Language Models

    Mar 19, 2026Aravind Krishnan, Karolina Stańczak, Dietrich KlakowLarge Language Model JailbreaksJailbreak Attacks

  16. Sparse Autoencoders are Capable LLM Jailbreak Mitigators

    Feb 12, 2026Yannick Assogba, Jacopo Cortellazzi, Javier Abad +3Jailbreak AttacksLarge Language Model Safety

  17. When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models

    Feb 10, 2026Jiacheng Hou, Yining Sun, Ruochong Jin +4Image EditingJailbreak Attacks

  18. Robustness of Vision Language Models Against Split-Image Harmful Input Attacks

    Feb 8, 2026Md Rafi Ur Rashid, MD Sadik Hossain Shanto, Vishnu Asutosh Dasu +1Recent Vision-Language ModelsWhite-Box Spectral-Subspace-Guided Attack

  19. In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement

    Jan 19, 2026Anudeex Shetty, Aditya Joshi, Salil S. KanhereLarge Language Model SafetyJailbreak Attacks

  20. SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses

    Oct 17, 2025Hanbin Hong, Shuang Wu, Shuya Feng +6Large Language Model SafetyLarge Language Model Evaluation

  21. Attention Misses Visual Risk: Risk-Adaptive Steering for Multimodal Safety Alignment

    Oct 15, 2025Jonghyun Park, Minhyuk Seo, Chaewon Yeo +1Safety AlignmentInference-Time Defense

  22. NonTextual Target Attack

    Oct 3, 2025Xinzhe Huang, Wenjing Hu, Tianhang Zheng +6Attacker Large Language ModelGradient-Based Attacks

  23. Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks

    Oct 1, 2025Shoumik Saha, Jifan Chen, Sam Mayers +3Jailbreak AttacksSecurity Evaluation

  24. Context Misleads LLMs: The Role of Context Filtering in Maintaining Safe Alignment of LLMs

    Aug 9, 2025Jinhwa Kim, Ian G. HarrisJailbreak AttacksLarge Language Models Fail

  25. Decoding One Safety Trigger Token for Balancing Safety and Usability in Large Language Models

    May 12, 2025Haoran Gu, Handing Wang, Yi Mei +2Large Language Model SafetyJailbreak Attacks

  26. GuidedBench: Measuring and Mitigating the Evaluation Discrepancies of In-the-wild LLM Jailbreak Methods

    Feb 24, 2025Ruixuan Huang, Xunguang Wang, Zongjie Li +2Large Language Model JailbreaksJailbreak Attacks

  27. Divide and Conquer: A Hybrid Strategy Defeats Multimodal Large Language Models

    Dec 21, 2024Yanxu Mao, Peipei Liu, Tiehan Cui +3Large Language Model JailbreaksJailbreak Attacks