LLM Jailbreak Attacks

LLM: Large Language Model

Momentum

7 papers in the last four weeks, down 12% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 137

All topics
CardsList
  1. Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations

    May 27, 2026Matteo Gioele Collu, Riccardo Conte, Alberto Giaretta +4LLM InterpretabilityAdversarial Attacks on LLMs

  2. BAIT: Boundary-Guided Disclosure Escalation LLM Jailbreaking via Self-Conditioned Reasoning

    May 26, 2026Xuan Luo, Yue Wang, Geng Tu +2Jailbreak AttacksLLM Safety

  3. Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks

    May 26, 2026Kevin Kuo, Virginia Smith, Chhavi YadavLLM Fine-TuningAdversarial Attacks on LLMs

  4. Furina: Fragmented Uncertainty-Driven Refusal Instability Attack

    May 24, 2026Tongxi Wu, Jian Zhang, Yang GaoAdversarial Attacks on VLMsLLM Safety

  5. Reasoning as an Attack Surface: Adaptive Evolutionary CoT Jailbreaks for LLMs

    May 23, 2026Jianan Li, Simeng Qin, Xiaojun Jia +5Adversarial Attacks on LLMsLLM Jailbreak Attacks

  6. LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models

    May 20, 2026Abdullah Al Nomaan Nafi, Fnu Suya, Swarup Bhunia +1Adversarial Prompt GenerationLLM Jailbreak Attacks

  7. REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak

    May 20, 2026Jiachen Ma, Jiawen Zhang, Xiangtian Li +3LLM Self-RefinementLLM Safety

  8. Attention-Guided Reward for Reinforcement Learning-based Jailbreak against Large Reasoning Models

    May 19, 2026Zheng Lin, Zhenxing Niu, Haoxuan Ji +2Adversarial Attacks on LLMsLLM Jailbreak Attacks

  9. Adaptive Probe-based Steering for Robust LLM Jailbreaking

    May 19, 2026Junxi Chen, Junhao Dong, Xiaohua XieLanguage Model SteeringAdversarial Attacks on LLMs

  10. Exploring and Developing a Pre-Model Safeguard with Draft Models

    May 19, 2026Hongyu Cai, Arjun Arunasalam, Yiming Liang +2LLM GuardrailsSafety Filtering

  11. Multilingual jailbreaking of LLMs using low-resource languages

    May 18, 2026Dylan Marx, Marcel DunaiskiLanguage Model Safety EvaluationLLM Jailbreak Attacks

  12. Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models

    May 18, 2026Yanyun Wang, Yu Huang, Zi Liang +2LLM AlignmentAudio-Language Models

  13. Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling

    May 18, 2026Ziwei Wang, Jing Chen, Ruichao Liang +6LLM SafetyLLM Jailbreak Attacks

  14. New Wide-Net-Casting Jailbreak Attacks Risk Large Models

    May 16, 2026Qiuchi Xiang, Haoxuan Qu, Hossein Rahmani +1Language Model Safety EvaluationJailbreak Attacks

  15. The Great Pretender: A Stochasticity Problem in LLM Jailbreak

    May 14, 2026Jean-Philippe Monteuuis, Cong Chen, Jonathan PetitLLM Safety BenchmarksLLM Evaluation

  16. LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs

    May 13, 2026Rodrigo Nogueira, Thales Sales Almeida, Giovana Kerche Bonás +7Adversarial Prompt GenerationLLM Guardrails

  17. Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation

    May 12, 2026Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed +1Adversarial TrainingAdversarial Prompt Generation

  18. LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments

    May 11, 2026Chiyu Zhang, Huiqin Yang, Bendong Jiang +8AI Agent Security BenchmarksLLM Jailbreak Attacks

  19. Re-Triggering Safeguards within LLMs for Jailbreak Detection

    May 11, 2026Zheng Lin, Zhenxing Niu, Haoxuan Ji +2LLM Jailbreak AttacksJailbreak Detection

  20. Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization

    May 11, 2026Huilin Zhou, Jian Zhao, Yilu Zhong +7Inference-Time OptimizationAdversarial Attacks on LLMs

  21. Restricting the Model, Missing the System: Measurement and Accountability in Offensive AI Governance

    May 10, 2026Michael Alexander Riegler, Finn Schwall, Annika Willoch Olstad +4AI Agent SecurityAI Safety Evaluation

  22. MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks

    May 10, 2026Xinkai Zhang, Zhipeng Wei, Huanli Gong +4Language Model Safety EvaluationJailbreak Attacks

  23. The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring

    May 9, 2026Ismail Hossain, Tanzim Ahad, Md Jahangir Alam +3Adversarial Prompt GenerationLanguage Model Safety Evaluation

  24. Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs

    May 9, 2026Sangyeon Yoon, Wonje Jeung, Yoonjun Cho +2Direct Preference OptimizationLLM Fine-Tuning

  25. Why Do Aligned LLMs Remain Jailbreakable: Refusal-Escape Directions, Operator-Level Sources, and Safety-Utility Trade-off

    May 9, 2026Yu Chen, Yuanhao Liu, Qi CaoLLM AlignmentLanguage Model Steering

  26. Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking

    May 9, 2026Zhida He, Xiaoyu Wen, Han Qi +7RL for Language ModelsCredit Assignment in RL