Jailbreak Detection

Momentum

1 paper in the last four weeks, against 2 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 28

All topics
CardsList
  1. Reflex-Guard: A Low-Latency Guardrail for LLM Prompt Safety Using Dense Semantic Embeddings

    Aug 18, 2026Istiaque Ahmed, Afia Anjum Borsha, Ranat Das Prangon +2LLM GuardrailsAdversarial Attacks on LLMs

  2. Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models

    Jun 26, 2026Yanchen Yin, Dongqi Han, Linghui LiAttention Head AnalysisJailbreak Attacks

  3. What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics

    Jun 23, 2026Sofiia Nikolenko, Michele Papucci, Mina Rezaei +1LLM InterpretabilityLLM Jailbreak Attacks

  4. Rapid Poison: Practical Poisoning Attacks Against the Rapid Response Framework

    Jun 15, 2026David Huang, Jaewon Chang, Avidan Shah +2LLM Backdoor AttacksPrompt Injection Attacks

  5. BELLS-O: Evaluating the Operational Trade-offs of LLM Supervision Systems

    Jun 12, 2026Leonhard Waibl, Felix Michalak, Hadrien MariacciaLLM Safety BenchmarksLLM Guardrails

  6. GuardNet: Ensemble Strategies of Shallow Neural Networks for Robust Prompt Injection and Jailbreak Detection

    Jun 4, 2026Paulo Ricardo Ferreira Neves, Edson Rodrigues da Cruz Filho, Paulo Henrique Eleuterio Falsetti +7LLM GuardrailsNeural Network Robustness

  7. Evolving and Detecting Multi-Turn Deception using Geometric Signatures

    May 26, 2026Surender Suresh Kumar, Mary L. CummingsAdversarial Prompt GenerationDeception in Language Models

  8. Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection

    May 24, 2026Lixing Lin, Juli You, Yue Li +4Language Model Safety EvaluationLLM Guardrails

  9. Detecting Fluent Optimization-Based Adversarial Prompts via Sequential Entropy Changes

    May 19, 2026Mohammed Alshaalan, Miguel R. D. RodriguesAdversarial Attacks on LLMsJailbreak Detection

  10. Exploring and Developing a Pre-Model Safeguard with Draft Models

    May 19, 2026Hongyu Cai, Arjun Arunasalam, Yiming Liang +2LLM GuardrailsSafety Filtering

  11. Re-Triggering Safeguards within LLMs for Jailbreak Detection

    May 11, 2026Zheng Lin, Zhenxing Niu, Haoxuan Ji +2LLM Jailbreak AttacksJailbreak Detection

  12. GLiGuard: Schema-Conditioned Classification for LLM Safeguard

    May 8, 2026Urchade Zaratiana, Mary Newhauser, George Hurn-Maloney +1LLM GuardrailsText Classification

  13. Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection

    May 2, 2026Xulin Hu, Che Wang, Wei Yang Bryan Lim +2Adversarial Attacks on LLMsLLM Refusal Behavior

  14. TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning

    Apr 30, 2026Bowen Sun, Chaozhuo Li, Yaodong Yang +2Jailbreak AttacksLLM Security

  15. Cross-Lingual Jailbreak Detection via Semantic Codebooks

    Apr 28, 2026Shirin Alanova, Bogdan Minko, Sabrina Sadiekh +1Multilingual Language Model EvaluationLLM Security

  16. One Jailbreak, Many Tongues: Learning Language-Insensitive Intention Representations for Multilingual Jailbreak Detection

    Apr 22, 2026Shuyu Jiang, Kaiyu Xu, Xingshu Chen +5Multilingual Language ModelsLLM Jailbreak Attacks

  17. An Empirical Study of Multi-Generation Sampling for Jailbreak Detection in Large Language Models

    Apr 20, 2026Hanrui Luo, Shreyank N GowdaLanguage Model Safety EvaluationLLM Auditing

  18. SafeDream: Safety World Model for Proactive Early Jailbreak Detection

    Apr 18, 2026Bo Yan, Weikai Lin, Yada Zhu +1Language Model Safety EvaluationWorld Models

  19. Segment-Level Coherence for Robust Harmful Intent Probing in LLMs

    Apr 16, 2026Xuanli He, Bilgehan Sel, Faizan Ali +3LLM SafetyLLM Jailbreak Attacks