Jailbreak Defense

Latest papers 43

All topics
CardsList
  1. PatchBench: Measuring Collateral Damage in Activation Patching

    Oct 7, 2026Alexi Canesse, Mathis Le Bail, Maël Jenny +3Language Model Safety EvaluationJailbreak Defense

  2. TRACE: Trajectory Return Attribution and Contrastive Erasure for Multi-Turn Safety

    Oct 1, 2026Fengpeng Li, Kemou Li, Qizhou Wang +3LLM Fine-TuningAdversarial Attacks on LLMs

  3. MOMAT: Mixture of Multiple Atlases for Low-Power Jailbreak Defense of Quantized LLMs

    Oct 1, 2026Boyang Li, Bingyu Shen, Weihao Hong +6Retrieval-Augmented GenerationLLM Safety

  4. SEAL: Reinforcing Global Safety in Mixture-of-Experts through Shared Expert ALignment

    Sep 2, 2026Qingyu Meng, Yiwei Zha, Jiahuan Pei +3LLM Safety AlignmentJailbreak Defense

  5. TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

    Aug 16, 2026Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu +1Adversarial TrainingLLM Jailbreak Attacks

  6. When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs

    Jul 27, 2026Tong Zhang, Zexin Li, Simin Chen +1LLM Inference EfficiencyLanguage Model Safety Evaluation

  7. SafeSpec: Fast and Safe LLM via Dynamic Reflective Sampling

    Jun 18, 2026Haotian Xu, Zeyang Zhang, Linbao Li +3Speculative DecodingLLM Inference Acceleration

  8. Adaptive and Explicit safe: Triggering Latent Safety Awareness in Large Reasoning Models

    Jun 15, 2026Ke Miao, Jiaxin Li, Hongliang Chen +2LLM Safety AlignmentLLM Safety

  9. DoubtProbe: Black-Box Jailbreak Defense via Structural Verification and Semantic Auditing

    Jun 15, 2026Xuanyu Yin, Yilin Jiang, Jun Zhou +3LLM AuditingLLM Jailbreak Attacks

  10. PsychoPass: Geometric Profiling of Multi-Turn Adversarial LLM Conversations

    Jun 2, 2026Muberra Ozmen, Subhabrata MajumdarAdversarial Attacks on LLMsLLM Safety

  11. THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models

    Jun 1, 2026Zhiqing Ma, Zhonghao Xu, Dong Yu +3LLM SafetyMulti-Turn Jailbreak Attacks

  12. EvoDefense: Co-Evolving Black-Box Defense with Large Language Models

    May 29, 2026Yu Li, Yuenan Hou, Yingmei Wei +2Evolutionary OptimizationAdversarial Attacks on LLMs

  13. Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security

    May 27, 2026Xiang Fang, Wanlong FangLLM SecurityPrompt Injection Defense

  14. Evolving and Detecting Multi-Turn Deception using Geometric Signatures

    May 26, 2026Surender Suresh Kumar, Mary L. CummingsAdversarial Prompt GenerationDeception in Language Models

  15. Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection

    May 24, 2026Lixing Lin, Juli You, Yue Li +4Language Model Safety EvaluationLLM Guardrails

  16. Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation

    May 23, 2026Luoyu Chen, Weiqi Wang, Zhiyi Tian +5Adversarial TrainingAdversarial Robustness of Language Models

  17. Exploring and Developing a Pre-Model Safeguard with Draft Models

    May 19, 2026Hongyu Cai, Arjun Arunasalam, Yiming Liang +2LLM GuardrailsSafety Filtering

  18. Adaptive Steering and Remasking for Safe Generation in Diffusion Language Models

    May 13, 2026Yejin Lee, Ungsik Kim, Yo-Sub HanAdversarial Attacks on LLMsDiffusion Language Model Inference

  19. Re-Triggering Safeguards within LLMs for Jailbreak Detection

    May 11, 2026Zheng Lin, Zhenxing Niu, Haoxuan Ji +2LLM Jailbreak AttacksJailbreak Detection

  20. GLiGuard: Schema-Conditioned Classification for LLM Safeguard

    May 8, 2026Urchade Zaratiana, Mary Newhauser, George Hurn-Maloney +1LLM GuardrailsText Classification

  21. Mitigating Many-shot Jailbreak Attacks with One Single Demonstration

    May 8, 2026Kejia Chen, Jiawen Zhang, Boheng Li +6Jailbreak AttacksIn-Context Learning