LLM Jailbreak Attacks

LLM: Large Language Model

Momentum

7 papers in the last four weeks, down 12% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 137

All topics
CardsList
  1. Mitigating Many-shot Jailbreak Attacks with One Single Demonstration

    May 8, 2026Kejia Chen, Jiawen Zhang, Boheng Li +6Jailbreak AttacksIn-Context Learning

  2. A Systematic Investigation of RL-Jailbreaking in LLMs

    May 7, 2026Montaser Mohammedalamen, Kevin Roice, Reginald McLean +1Language Model Safety EvaluationAdversarial Attacks on LLMs

  3. On the Hardness of Junking LLMs

    May 6, 2026Marco Rando, Samuel VaiterLLM Backdoor AttacksLLM Jailbreak Attacks

  4. SoK: Robustness in Large Language Models against Jailbreak Attacks

    May 6, 2026Feiyue Xu, Hongsheng Hu, Chaoxiang He +9Language Model Safety EvaluationLLM Security

  5. Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization

    May 6, 2026Zheng Fang, Xiaosen Wang, Shenyi Zhang +2Deep Learning OptimizationAudio-Language Models

  6. Self-Mined Hardness for Safety Fine-Tuning

    May 4, 2026Prakhar Gupta, Garv Shah, Donghua ZhangHard Negative MiningLLM Fine-Tuning

  7. ContextualJailbreak: Evolutionary Red-Teaming via Simulated Conversational Priming

    May 4, 2026Mario Rodríguez Béjar, Francisco J. Cortés-Delgado, S. Braghin +1Evolutionary OptimizationLLM Red Teaming

  8. Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment

    May 3, 2026Jiajia Li, Xiaoyu Wen, Zhongtian Ma +3LLM AlignmentLLM Safety Alignment

  9. MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

    May 3, 2026Jialin Song, Xiaodong Liu, Weiwei Yang +4LLM Safety BenchmarksAdversarial Prompt Generation

  10. SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking

    May 1, 2026Jindong Li, Ying Liu, Yali Fu +4LLM Jailbreak Attacks

  11. RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs

    May 1, 2026Zhiyuan Xu, Joseph Gardiner, Sana Belguith +1Mixture-of-Experts Language ModelsAdversarial Attacks on LLMs

  12. TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning

    Apr 30, 2026Bowen Sun, Chaozhuo Li, Yaodong Yang +2Jailbreak AttacksLLM Security

  13. Cross-Lingual Jailbreak Detection via Semantic Codebooks

    Apr 28, 2026Shirin Alanova, Bogdan Minko, Sabrina Sadiekh +1Multilingual Language Model EvaluationLLM Security

  14. Adaptive Prompt Embedding Optimization for LLM Jailbreaking

    Apr 27, 2026Miles Q. Li, Benjamin C. M. Fung, Boyang Li +2Adversarial Prompt GenerationAdversarial Attacks on LLMs

  15. Jailbreaking Frontier Foundation Models Through Intention Deception

    Apr 27, 2026Xinhe Wang, Katia Sycara, Yaqi XieJailbreak AttacksLLM Safety

  16. Evaluating Jailbreaking Vulnerabilities in LLMs Deployed as Assistants for Smart Grid Operations: A Benchmark Against NERC Standards

    Apr 25, 2026Taha Hammadia, Lucas Rea, Ahmad Mohammad Saber +2LLM Jailbreak AttacksLLM Safety Evaluation

  17. From Concept-Aligned Tokens to Vulnerable Features: Mechanistic Localization of Jailbreaks

    Apr 25, 2026Nilanjana Das, Mathew Dawit, Aman Chadha +1LLM InterpretabilitySparse Autoencoders

  18. AVISE: Framework for Evaluating the Security of AI Systems

    Apr 22, 2026Mikko Lempinen, Joni Kemppainen, Niklas RaesalmiLanguage Model Safety EvaluationAdversarial Attacks on LLMs

  19. One Jailbreak, Many Tongues: Learning Language-Insensitive Intention Representations for Multilingual Jailbreak Detection

    Apr 22, 2026Shuyu Jiang, Kaiyu Xu, Xingshu Chen +5Multilingual Language ModelsLLM Jailbreak Attacks

  20. EvoJail: Evolutionary Diverse Jailbreak Prompt Generation for Large Language Models

    Apr 22, 2026Rui Tang, Kaiyu Xu, Pengsen Cheng +3Adversarial Prompt GenerationLLM Jailbreak Attacks

  21. Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks

    Apr 20, 2026Md Rysul Kabir, Zoran TiganjLanguage Model Safety EvaluationLLM Interpretability

  22. Jailbreaking Large Language Models with Morality Attacks

    Apr 18, 2026Ying Su, Mingen Zheng, Weili Diao +1Moral Reasoning in Language ModelsLanguage Model Safety Evaluation

  23. SafeDream: Safety World Model for Proactive Early Jailbreak Detection

    Apr 18, 2026Bo Yan, Weikai Lin, Yada Zhu +1Language Model Safety EvaluationWorld Models

  24. Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing

    Apr 17, 2026Zehao Wang, Lanjun WangAdversarial Prompt GenerationJailbreak Attacks

  25. Segment-Level Coherence for Robust Harmful Intent Probing in LLMs

    Apr 16, 2026Xuanli He, Bilgehan Sel, Faizan Ali +3LLM SafetyLLM Jailbreak Attacks