LLM Jailbreak Attacks

LLM: Large Language Model

Momentum

7 papers in the last four weeks, down 12% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 137

All topics
CardsList
  1. How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense

    Oct 7, 2026Zhankai Ye, Yanning Wang, Yukai Jin +5Refusal Behavior in Language ModelsLLM Safety Alignment

  2. PatchBench: Measuring Collateral Damage in Activation Patching

    Oct 7, 2026Alexi Canesse, Mathis Le Bail, Maël Jenny +3Language Model Safety EvaluationJailbreak Defense

  3. From Expected Harmfulness to Likelihood: A Probabilistic Reformulation of Jailbreaking LLM Agents

    Oct 7, 2026Juanyang Xu, Zheng Wang, Xingyu Zhao +2Jailbreak AttacksLLM Jailbreak Attacks

  4. Secure Speculative Decoding for Large Language Models

    Oct 6, 2026Yichi Zhang, Zhiqi Wang, Neil Gong +1Adversarial Attacks on LLMsSpeculative Decoding

  5. Jailbreaking Open-Weight LLMs via Random Embedding Perturbations

    Oct 5, 2026Abhinav Sudhakar Dubey, Scott Sirri, Vaggos Chatziafratis +1Adversarial AttacksAdversarial Attacks on LLMs

  6. Benchmarking Jailbreak Guardrails for Embodied Agents

    Oct 5, 2026Xunguang Wang, Qingyue Wang, Yuguang Zhou +3LLM GuardrailsAI Agent Safety

  7. Red-TTT: Test-Time Training for Automated Jailbreaking Large Language Models

    Oct 4, 2026Tongyan Hu, Hao Li, Xiaogeng Liu +8Test-Time TrainingLLM Jailbreak Attacks

  8. CodeMimicry: Exploiting Safety Generalization Lag in Large Language Models via Structured Code Completion

    Sep 30, 2026Zhen Liang, Hai Huang, Wentao ChenAdversarial Attacks on LLMsJailbreak Attacks

  9. Controlled Decoding Attacks on Black-Box LLMs

    Sep 29, 2026Jesson Wang, Shawn Li, Wei Yang +4Constrained DecodingAdversarial Attacks on LLMs

  10. On the Efficiency-Safety Dilemma in Large Reasoning Models

    Sep 20, 2026Yifei Yang, Zouying Cao, Xingrui Wang +4LLM Inference AccelerationLLM Jailbreak Attacks

  11. SoK: Rethinking Jailbreaking in the Era of Agentic AI: Attacks, Defenses, and Practical Consideration

    Sep 14, 2026Md Jueal Mia, Yanzhao Wu, Selcuk Uluagac +1Language Model Safety EvaluationJailbreak Robustness

  12. IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks

    Sep 3, 2026Saikat Mondal, Mamta, Deeksha Varshney +2LLM Safety BenchmarksMultilingual Language Model Evaluation

  13. ASCII Attack: Recontextualising Harmful Requests as Artistic Critique in Large Language Models

    Sep 2, 2026Da Cheng Gu, Yifei Dong, Xinghao Yang +2LLM Jailbreak AttacksLLM Safety Evaluation

  14. Breadth Beats Depth: Improving GCG-Based Jailbreak Optimization with Breadth-Oriented Suffix Search

    Sep 2, 2026Shiliang Xiao, Jingsong Wei, Yuzhi Liang +3LLM Jailbreak AttacksAdversarial Prompt Generation

  15. The Fragility of Jailbreak Robustness Across Operational States

    Aug 31, 2026Yuna Park, Hwang Youn Kim, Yujin Kim +3Prompt SensitivityLanguage Model Safety Evaluation

  16. The Safety Relay in Roleplay Jailbreaks: A Component-Resolved Causal Analysis of Harm Recognition and Refusal

    Aug 31, 2026Md Mokarram Chowdhury, Ernie Chang, Yang LiJailbreak AttacksLLM Jailbreak Attacks

  17. TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

    Aug 16, 2026Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu +1Adversarial TrainingLLM Jailbreak Attacks

  18. Measuring the Wrong Thing: Internal Harmfulness Scores Anti-Rank Successful Jailbreaks

    Aug 10, 2026Mingyu Luo, Ming Deng, Zilang Qiu +8Safety FilteringLLM Jailbreak Attacks

  19. Yesterday's Shield, Today's Spear: A Self-Evolving Safety Guardrail in Production

    Aug 9, 2026Cong Ming, Jingyi Chen, Bin Liu +4Continual Learning for LLMsLLM Guardrails

  20. ICO: Enhancing Semantic-Shift Jailbreaks via Iterative Context Optimization

    Aug 4, 2026Hujian Zhu, Yihao Huang, Felix Juefei-Xu +5Adversarial Attacks on LLMsJailbreak Attacks

  21. RoguePrompt: Dual-Layer Encoding for Self-Reconstruction to Circumvent LLM Moderation

    Jul 29, 2026Benyamin Tafreshian, Prathamesh DhakeAdversarial AttacksAdversarial Attacks on LLMs

  22. Do LLMs Know Their Vulnerable Scenarios?

    Jul 26, 2026Ziheng Peng, Huiqi Deng, Haoran Jing +5LLM InterpretabilityAdversarial Scenario Generation

  23. Geometric Configurations of Perturbed Jailbreak Prompts

    Jul 22, 2026Lynn Delcon, Andres Algaba, Vincent GinisJailbreak AttacksLLM Jailbreak Attacks

  24. An Early Warning of Emerging Biosecurity Risks in Frontier LLMs

    Jul 20, 2026Zhida He, Xia Hu, Baichen Le +20Language Model Safety EvaluationLLM Security

  25. JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models

    Jul 20, 2026Qingjia Huang, Jingyu Zhang, Jianguo Wu +6LLM Safety BenchmarksLLM Jailbreak Attacks