LLM Jailbreak Attacks

LLM: Large Language Model

Momentum

7 papers in the last four weeks, down 12% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 137

All topics
CardsList
  1. On Optimizing Multimodal Jailbreaks for Spoken Language Models

    Mar 19, 2026Aravind Krishnan, Karolina Stańczak, Dietrich KlakowAdversarial AttacksLLM Jailbreak Attacks

  2. Sparse Autoencoders are Capable LLM Jailbreak Mitigators

    Feb 12, 2026Yannick Assogba, Jacopo Cortellazzi, Javier Abad +3Sparse AutoencodersLLM Jailbreak Attacks

  3. In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement

    Jan 19, 2026Anudeex Shetty, Aditya Joshi, Salil S. KanhereLanguage Model Safety EvaluationAdversarial Attacks on LLMs

  4. Safety Is Not Universal: The Selective Safety Trap in LLM Alignment

    Jan 7, 2026Iago Alves Brito, Walcy Santos Rezende Rios, Julia Soares Dollis +2LLM Safety BenchmarksLLM Alignment

  5. SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses

    Oct 17, 2025Hanbin Hong, Shuang Wu, Shuya Feng +6LLM SecurityLLM Jailbreak Attacks

  6. Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks

    Oct 16, 2025Trilok Padhi, Pinxian Lu, Abdulkadir Erol +5Adversarial Attacks on LLMsAI Agent Security Benchmarks

  7. NonTextual Target Attack

    Oct 3, 2025Xinzhe Huang, Wenjing Hu, Tianhang Zheng +6Adversarial Prompt GenerationAdversarial Attacks on LLMs

  8. Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks

    Oct 1, 2025Shoumik Saha, Jifan Chen, Sam Mayers +3AI Coding AgentsAI Agent Security

  9. Context Misleads LLMs: The Role of Context Filtering in Maintaining Safe Alignment of LLMs

    Aug 9, 2025Jinhwa Kim, Ian G. HarrisLLM Safety AlignmentLLM Safety

  10. LLMs Encode Harmfulness and Refusal Separately

    Jul 16, 2025Jiachen Zhao, Jing Huang, Zhengxuan Wu +2LLM InterpretabilityLLM Refusal Behavior

  11. HauntAttack: When Attack Follows Reasoning as a Shadow

    Jun 8, 2025Jingyuan Ma, Rui Li, Zheng Li +4Adversarial Attacks on LLMsJailbreak Attacks

  12. Decoding One Safety Trigger Token for Balancing Safety and Usability in Large Language Models

    May 12, 2025Haoran Gu, Handing Wang, Yi Mei +2LLM Safety AlignmentLLM Safety

  13. Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models

    Mar 8, 2025Thomas Winninger, Boussad Addad, Katarzyna KapustaAdversarial Prompt GenerationAdversarial Attacks on LLMs

  14. GuidedBench: Measuring and Mitigating the Evaluation Discrepancies of In-the-wild LLM Jailbreak Methods

    Feb 24, 2025Ruixuan Huang, Xunguang Wang, Zongjie Li +2Language Model Safety EvaluationLLM Jailbreak Attacks

  15. Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge

    Apr 8, 2024Weikai Lu, Ziqian Zeng, Jianwei Wang +5LLM Safety AlignmentLLM Jailbreak Attacks