Jailbreak Attacks

Latest papers 48

All topics
CardsList
  1. PatchBench: Measuring Collateral Damage in Activation Patching

    Oct 7, 2026Alexi Canesse, Mathis Le Bail, Maël Jenny +3Language Model Safety EvaluationJailbreak Defense

  2. From Expected Harmfulness to Likelihood: A Probabilistic Reformulation of Jailbreaking LLM Agents

    Oct 7, 2026Juanyang Xu, Zheng Wang, Xingyu Zhao +2Jailbreak AttacksLLM Jailbreak Attacks

  3. CodeMimicry: Exploiting Safety Generalization Lag in Large Language Models via Structured Code Completion

    Sep 30, 2026Zhen Liang, Hai Huang, Wentao ChenAdversarial Attacks on LLMsJailbreak Attacks

  4. SceneJail: Exploiting Video Scenario Context to Jailbreak Multimodal LLMs

    Sep 30, 2026Wenyu Chen, Li Wang, Chuanchao Zang +5VLM RobustnessJailbreak Attacks

  5. DuplexJail: Spoken Interruption Attacks on Full-Duplex Speech Models

    Sep 8, 2026Jaechul Roh, Deepak Chandran, Amir Houmansadr +1Language Model Safety EvaluationJailbreak Attacks

  6. Does Deeper Reasoning Compromise Alignment? Revealing and Mitigating of Alignment Collapse in Large Reasoning Models

    Sep 8, 2026Yu-Hang Wu, Yu-Jie Xiong, Henghua Zhang +3Adversarial Attacks on LLMsJailbreak Attacks

  7. The Safety Relay in Roleplay Jailbreaks: A Component-Resolved Causal Analysis of Harm Recognition and Refusal

    Aug 31, 2026Md Mokarram Chowdhury, Ernie Chang, Yang LiJailbreak AttacksLLM Jailbreak Attacks

  8. ICO: Enhancing Semantic-Shift Jailbreaks via Iterative Context Optimization

    Aug 4, 2026Hujian Zhu, Yihao Huang, Felix Juefei-Xu +5Adversarial Attacks on LLMsJailbreak Attacks

  9. Geometric Configurations of Perturbed Jailbreak Prompts

    Jul 22, 2026Lynn Delcon, Andres Algaba, Vincent GinisJailbreak AttacksLLM Jailbreak Attacks

  10. Adversarial Prompting Framework for AI Safety Assessment

    Jul 15, 2026Yash Bhatnagar, Kunal Banerjee, Anirban ChatterjeeAdversarial Prompt GenerationAdversarial Attacks on LLMs

  11. Safety Targeted Embedding Exploit via Refinement

    Jul 2, 2026Joshua Adrian CahyonoMultilingual Language Model EvaluationAdversarial Attacks on LLMs

  12. Resolution Thresholds in VLM Detection of Harmful ASCII Art Across Construction Modes and Languages

    Jun 28, 2026Yikai Hua, Peter WestVLM EvaluationVLM Robustness

  13. Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models

    Jun 26, 2026Yanchen Yin, Dongqi Han, Linghui LiAttention Head AnalysisJailbreak Attacks

  14. Analyzing Defensive Misdirection Against Model-Guided Automated Attacks on Agentic AI Systems

    Jun 18, 2026Reza Soosahabi, Vivek NamsaniAdversarial RobustnessJailbreak Attacks

  15. Context-Fractured Decomposition Attacks on Tool-Using LLM Agents: Exploiting Artifact Provenance Gaps

    Jun 8, 2026Xiaofeng Lin, Yukai Yang, Daniel Guo +3Jailbreak AttacksLLM Agent Security

  16. SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech

    Jun 4, 2026Virginia Ceccatelli, Yejin Jeon, David Ifeoluwa AdelaniAudio-Language Model EvaluationLanguage Model Safety Evaluation

  17. Voices Across Registers: Corpus-Conditioned Vernacular Jailbreaks against Aligned LLMs via Fanfiction Subgenres

    Jun 3, 2026Zhongze Luo, Ruihe Shi, Zhenshuai Yin +3Adversarial Prompt GenerationLanguage Model Safety Evaluation

  18. BAIT: Boundary-Guided Disclosure Escalation LLM Jailbreaking via Self-Conditioned Reasoning

    May 26, 2026Xuan Luo, Yue Wang, Geng Tu +2Jailbreak AttacksLLM Safety

  19. Test-Time Training Undermines Safety Guardrails

    May 21, 2026Simone Antonelli, Sadegh Akhondzadeh, Aleksandar BojchevskiLanguage Model Safety EvaluationAdversarial Attacks on LLMs

  20. New Wide-Net-Casting Jailbreak Attacks Risk Large Models

    May 16, 2026Qiuchi Xiang, Haoxuan Qu, Hossein Rahmani +1Language Model Safety EvaluationJailbreak Attacks

  21. Metaphor Is Not All Attention Needs

    May 12, 2026Olga Sorokoletova, Francesco Giarrusso, Giacomo De Luca +6Adversarial Attacks on LLMsJailbreak Attacks

  22. MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks

    May 10, 2026Xinkai Zhang, Zhipeng Wei, Huanli Gong +4Language Model Safety EvaluationJailbreak Attacks

  23. Single-Configuration Attack Success Rate Is Not Enough: Jailbreak Evaluations Should Report Distributional Attack Success

    May 9, 2026Carsten Maple, Abhishek Kumar, Riya TapwalLanguage Model Safety EvaluationJailbreak Attacks