LLM Jailbreak Attacks

LLM: Large Language Model

Momentum

7 papers in the last four weeks, down 12% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 137

All topics
CardsList
  1. MJ: Multi-turn LLM Jailbreaking via Decomposed Credit Assignment

    Jul 13, 2026Junyoung Park, Namgyu Park, Sechan Lee +3RL for Language ModelsLLM Jailbreak Attacks

  2. Trivial Prompt Reframing Bypasses Safety Guardrails in Googleś MedGemma-4B

    Jul 9, 2026Avi-ad Avraam BuskilaLLM Safety BenchmarksLanguage Model Safety Evaluation

  3. Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs

    Jul 8, 2026Anupam Wagle, Ifrat Ikhtear Uddin, Chaowei Zhang +1LLM InterpretabilityAdversarial Attacks on LLMs

  4. Beyond the Prompt: Jailbreaking Function-Calling LLMs via Simulated Moderation Traces

    Jul 1, 2026Junlong Liu, Haobo Wang, Weiqi Luo +1LLM SecurityLLM Jailbreak Attacks

  5. Jailbreaking for the Average Jane: Choosing Optimal Jailbreaks via Bandit Algorithms for Automatically Enhanced Queries

    Jun 25, 2026Prarabdh Shukla, Ritik, Suhas Rao +2Adversarial Attacks on LLMsLLM Jailbreak Attacks

  6. What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics

    Jun 23, 2026Sofiia Nikolenko, Michele Papucci, Mina Rezaei +1LLM InterpretabilityLLM Jailbreak Attacks

  7. The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs

    Jun 21, 2026Shivam Ratnakar, Kartikeya VatsLanguage Model SteeringAdversarial Attacks on LLMs

  8. OTTER: A Red-Teaming System for Toxicity-Evading Jailbreak Prompt Optimization

    Jun 19, 2026Jerry Wang, Hsin-Ling Hsu, Yi-Cheng Lai +2Adversarial Prompt GenerationAdversarial Attacks on LLMs

  9. Analyzing Defensive Misdirection Against Model-Guided Automated Attacks on Agentic AI Systems

    Jun 18, 2026Reza Soosahabi, Vivek NamsaniAdversarial RobustnessJailbreak Attacks

  10. A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models

    Jun 16, 2026Nicola FrancoLanguage Model Safety EvaluationNeural Network Robustness

  11. Automated jailbreak attack targeting multiple defense strategies

    Jun 15, 2026Qi Wang, Chengcheng Wan, Weijia He +4Adversarial Prompt GenerationLLM Jailbreak Attacks

  12. DoubtProbe: Black-Box Jailbreak Defense via Structural Verification and Semantic Auditing

    Jun 15, 2026Xuanyu Yin, Yilin Jiang, Jun Zhou +3LLM AuditingLLM Jailbreak Attacks

  13. GAS-Leak-LLM: Genetic Algorithm-Based Suffix Optimization for Black-Box LLM Jailbreaking

    Jun 14, 2026Aman Anifer, Vignesh Kumar Kembu, Vishnu M +4Adversarial Prompt GenerationLLM Safety

  14. Grammar-Constrained Decoding Can Jailbreak LLMs into Generating Malicious Code

    Jun 10, 2026Yitong Zhang, Shiteng Lu, Jia LiLLM Safety AlignmentLLM Jailbreak Attacks

  15. JailbreakOPT: Tool-Assisted Iterative Jailbreak Prompt Optimization

    Jun 9, 2026Ge Shi, Jun Yin, Donglin Xie +3Adversarial Prompt GenerationLarge Language Model-Guided Optimization

  16. Risk Under Pressure: Compute-Aware Evaluation of Adversarial Robustness in Language Models

    Jun 9, 2026Malikeh Ehghaghi, Boglárka Ecsedi, Marsha Chechik +1LLM AlignmentNeural Network Robustness

  17. Steering Vectors are an Adversarial Attack Surface

    Jun 4, 2026Abzal Aidakhmetov, Donato Crisostomi, Tommaso Mencattini +3Language Model SteeringAdversarial Attacks on LLMs

  18. Membrane: A Self-Evolving Contrastive Safety Memory for LLM Agent Defense

    Jun 4, 2026Minseok Choi, Seungbin Yang, Dongjin Kim +5LLM GuardrailsSafety Filtering

  19. Safety Paradox: How Enhanced Safety Awareness Leaves LLMs Vulnerable to Posterior Attack

    Jun 4, 2026Long P. Hoang, Hai V. Le, Shaoyang Xu +2Adversarial Attacks on LLMsLLM Safety Alignment

  20. Voices Across Registers: Corpus-Conditioned Vernacular Jailbreaks against Aligned LLMs via Fanfiction Subgenres

    Jun 3, 2026Zhongze Luo, Ruihe Shi, Zhenshuai Yin +3Adversarial Prompt GenerationLanguage Model Safety Evaluation

  21. Black-box, Adaptive, Efficient, Transferable, Harmful, Applicable... Attacks Are All You Need to Break LLMs

    Jun 2, 2026Vincent Limbach, Jonas Dornbusch, David Lüdke +2LLM Jailbreak AttacksLLM Safety Evaluation

  22. TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages

    May 31, 2026Victor Akinode, Senyu Li, Wassim Hamidouche +3LLM Safety BenchmarksMultilingual Language Model Evaluation