Jailbreak Defense

Latest papers 43

All topics
CardsList
  1. SoK: Robustness in Large Language Models against Jailbreak Attacks

    May 6, 2026Feiyue Xu, Hongsheng Hu, Chaoxiang He +9Language Model Safety EvaluationLLM Security

  2. Catching the Infection Before It Spreads: Foresight-Guided Defense in Multi-Agent Systems

    May 3, 2026Yue Ma, Ziyuan Yang, Yi ZhangMulti-Agent LLM SystemsJailbreak Defense

  3. Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection

    May 2, 2026Xulin Hu, Che Wang, Wei Yang Bryan Lim +2Adversarial Attacks on LLMsLLM Refusal Behavior

  4. TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning

    Apr 30, 2026Bowen Sun, Chaozhuo Li, Yaodong Yang +2Jailbreak AttacksLLM Security

  5. Cross-Lingual Jailbreak Detection via Semantic Codebooks

    Apr 28, 2026Shirin Alanova, Bogdan Minko, Sabrina Sadiekh +1Multilingual Language Model EvaluationLLM Security

  6. One Jailbreak, Many Tongues: Learning Language-Insensitive Intention Representations for Multilingual Jailbreak Detection

    Apr 22, 2026Shuyu Jiang, Kaiyu Xu, Xingshu Chen +5Multilingual Language ModelsLLM Jailbreak Attacks

  7. Towards Understanding the Robustness of Sparse Autoencoders

    Apr 20, 2026Ahson Saiyed, Sabrina Sadiekh, Chirag AgarwalAdversarial Attacks on LLMsJailbreak Robustness

  8. SafeDream: Safety World Model for Proactive Early Jailbreak Detection

    Apr 18, 2026Bo Yan, Weikai Lin, Yada Zhu +1Language Model Safety EvaluationWorld Models

  9. Sparse Autoencoders are Capable LLM Jailbreak Mitigators

    Feb 12, 2026Yannick Assogba, Jacopo Cortellazzi, Javier Abad +3Sparse AutoencodersLLM Jailbreak Attacks

  10. Attention Misses Visual Risk: Risk-Adaptive Steering for Multimodal Safety Alignment

    Oct 15, 2025Jonghyun Park, Minhyuk Seo, Chaewon Yeo +1Multimodal RobustnessLLM Safety Alignment

  11. Decoding One Safety Trigger Token for Balancing Safety and Usability in Large Language Models

    May 12, 2025Haoran Gu, Handing Wang, Yi Mei +2LLM Safety AlignmentLLM Safety

  12. Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge

    Apr 8, 2024Weikai Lu, Ziqian Zeng, Jianwei Wang +5LLM Safety AlignmentLLM Jailbreak Attacks