Jailbreak Attacks

Momentum

13 papers in the last four weeks, up 30% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 154

All topics
CardsList
  1. CodeMimicry: Exploiting Safety Generalization Lag in Large Language Models via Structured Code Completion

    Sep 30, 2026Zhen Liang, Hai Huang, Wentao ChenJailbreak AttacksVulnerable Code

  2. ACTR: Aligning Thoughts and Responses for Multilingual Safety in Reasoning LLMs

    Sep 29, 2026Xianhui Zhang, Jian Yu, Chengyu Xie +6Multilingual SafetyLarge Language Model Safety

  3. Controlled Decoding Attacks on Black-Box LLMs

    Sep 29, 2026Jesson Wang, Shawn Li, Wei Yang +4Large Language Model JailbreaksJailbreak Attacks

  4. SafeMol: Dual-Modality Safety Alignment for Molecular Multimodal Models

    Sep 27, 2026Xinmiao Wang, Ruijie Wang, Menghui Wang +5Safety AlignmentSafer

  5. On the Efficiency-Safety Dilemma in Large Reasoning Models

    Sep 20, 2026Yifei Yang, Zouying Cao, Xingrui Wang +4Large Reasoning ModelsJailbreak Attacks

  6. SoK: Rethinking Jailbreaking in the Era of Agentic AI: Attacks, Defenses, and Practical Consideration

    Sep 14, 2026Md Jueal Mia, Yanzhao Wu, Selcuk Uluagac +1Jailbreak AttacksJailbreaks

  7. The Price of Consistency: Exploiting Visual Anchors for Multimodal Jailbreaking in Video Generation

    Sep 7, 2026Peng Li, Qianqian Xu, Yangbangyan Jiang +2Generative Video ModelsVideo Generation

  8. IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks

    Sep 3, 2026Saikat Mondal, Mamta, Deeksha Varshney +2Large Language Model SafetyLarge Language Model Evaluation

  9. Validity-Aware Jailbreak Evaluation for Large Language Models

    Aug 31, 2026Qilong Wu, Sahil Wadhwa, Pranab Mohanty +2Large Language Model JailbreaksJailbreak Attacks

  10. The Fragility of Jailbreak Robustness Across Operational States

    Aug 31, 2026Yuna Park, Hwang Youn Kim, Yujin Kim +3Jailbreak AttacksAttack-Success Rate

  11. The Safety Relay in Roleplay Jailbreaks: A Component-Resolved Causal Analysis of Harm Recognition and Refusal

    Aug 31, 2026Md Mokarram Chowdhury, Ernie Chang, Yang LiJailbreaksJailbreak Attacks

  12. Fully Unleashing the Multimodal Attacker: Meta-Adaptive Jailbreaking of Vision-Language Models

    Aug 27, 2026Benlei Cui, Shen Pang, Yuke Wang +7Jailbreak Attacks

  13. TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

    Aug 16, 2026Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu +1Jailbreak AttacksTrajectory-Aware Hidden-State Analyses

  14. Stealing Reasoning Traces from Proprietary LLM APIs

    Aug 10, 2026Alexander Panfilov, David Schmotz, Ilia Shumailov +5LLM Reasoning StrategiesReasoning Traces

  15. Measuring the Wrong Thing: Internal Harmfulness Scores Anti-Rank Successful Jailbreaks

    Aug 10, 2026Mingyu Luo, Ming Deng, Zilang Qiu +8Jailbreak AttacksAttack-Success Rate

  16. Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs

    Aug 10, 2026Hongli Shen, Shaopeng Fu, Qinbo Zhang +2Safety AlignmentJailbreak Attacks

  17. Yesterday's Shield, Today's Spear: A Self-Evolving Safety Guardrail in Production

    Aug 9, 2026Cong Ming, Jingyi Chen, Bin Liu +4GuardrailLarge Language Model Safety

  18. ICO: Enhancing Semantic-Shift Jailbreaks via Iterative Context Optimization

    Aug 4, 2026Hujian Zhu, Yihao Huang, Felix Juefei-Xu +5Jailbreak AttacksWhite-Box Spectral-Subspace-Guided Attack

  19. Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems

    Aug 2, 2026Wanguang Li, Zhaoxin Wang, Handing WangAdversarial PromptsJailbreak Success Rates

  20. Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis

    Jul 29, 2026Jiachen Qian, Junyu LiText-To-AudioLarge Audio Language Models

  21. Geometric Configurations of Perturbed Jailbreak Prompts

    Jul 22, 2026Lynn Delcon, Andres Algaba, Vincent GinisLarge Language Model JailbreaksJailbreak Attacks

  22. Visual Token Compression Enhances Robustness of MLLMs

    Jul 21, 2026Shishen Gu, Jiequan Cui, Wenbo Hu +3Visual Token PruningRecent Vision-Language Models

  23. An Early Warning of Emerging Biosecurity Risks in Frontier LLMs

    Jul 20, 2026Zhida He, Xia Hu, Baichen Le +20Large Language Model SafetyLife Sciences Research

  24. JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models

    Jul 20, 2026Qingjia Huang, Jingyu Zhang, Jianguo Wu +6Large Language Model JailbreaksJailbreak Attacks

  25. How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions

    Jul 19, 2026Yukai Zhou, Feiyang Lu, Xiaokai Mao +2Jailbreak AttacksJailbreaks

  26. Refused in Chat, Written in Code: Workflow-Level Jailbreak Construction in IDE Coding Agents

    Jul 4, 2026Abhishek Kumar, Carsten MapleCoding AgentsLarge Language Model Safety

  27. Overloading Large Vision-Language Models for Jailbreaking

    Jul 3, 2026Haoyu Zhang, Yangyang Guo, Mohan KankanhalliLarge Language Model JailbreaksJailbreak Attacks

  28. Beyond the Prompt: Jailbreaking Function-Calling LLMs via Simulated Moderation Traces

    Jul 1, 2026Junlong Liu, Haobo Wang, Weiqi Luo +1Jailbreak AttacksPrompt Engineering

  29. Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models

    Jun 26, 2026Yanchen Yin, Dongqi Han, Linghui LiJailbreak AttacksLarge Language Model Safety

  30. Jailbreaking for the Average Jane: Choosing Optimal Jailbreaks via Bandit Algorithms for Automatically Enhanced Queries

    Jun 25, 2026Prarabdh Shukla, Ritik, Suhas Rao +2Jailbreak AttacksMalicious Agents

  31. VPA-Guard: Defending and Benchmarking Image-to-Video Generation Against Visual Prompt Attacks

    Jun 24, 2026Yining Sun, Haoyu Kang, Jiajun Wu +7Video GenerationJailbreak Attacks

  32. PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation

    Jun 23, 2026Leyi Sheng, Han Sun, Zhen Sun +4Text-To-ImageJailbreak Attacks

  33. OTTER: A Red-Teaming System for Toxicity-Evading Jailbreak Prompt Optimization

    Jun 19, 2026Jerry Wang, Hsin-Ling Hsu, Yi-Cheng Lai +2ToxicityRed-Teaming

  34. A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models

    Jun 16, 2026Nicola FrancoJailbreak AttacksRed-Teaming

  35. Adaptive and Explicit safe: Triggering Latent Safety Awareness in Large Reasoning Models

    Jun 15, 2026Ke Miao, Jiaxin Li, Hongliang Chen +2Large Language Model SafetyLarge Reasoning Models

  36. Automated jailbreak attack targeting multiple defense strategies

    Jun 15, 2026Qi Wang, Chengcheng Wan, Weijia He +4Attacker Large Language ModelJailbreak Attacks

  37. DoubtProbe: Black-Box Jailbreak Defense via Structural Verification and Semantic Auditing

    Jun 15, 2026Xuanyu Yin, Yilin Jiang, Jun Zhou +3Jailbreak AttacksJailbreaks

  38. BELLS-O: Evaluating the Operational Trade-offs of LLM Supervision Systems

    Jun 12, 2026Leonhard Waibl, Felix Michalak, Hadrien MariacciaJailbreak AttacksFirst Comprehensive Benchmark

  39. FreoStream:Enhancing Stream Guardrails via Future-Aware Reasoning and Safety-Aligned Optimization

    Jun 11, 2026Jianwei Wang, Guoyang Shen, Yanhong Wu +5Streaming GuardrailsLarge Language Model Safety

  40. Grammar-Constrained Decoding Can Jailbreak LLMs into Generating Malicious Code

    Jun 10, 2026Yitong Zhang, Shiteng Lu, Jia LiLarge Language Model JailbreaksJailbreak Attacks

  41. JailbreakOPT: Tool-Assisted Iterative Jailbreak Prompt Optimization

    Jun 9, 2026Ge Shi, Jun Yin, Donglin Xie +3Jailbreak AttacksPrompt Engineering

  42. Context-Fractured Decomposition Attacks on Tool-Using LLM Agents: Exploiting Artifact Provenance Gaps

    Jun 8, 2026Xiaofeng Lin, Yukai Yang, Daniel Guo +3Jailbreak AttacksLanguage-Model Agents

  43. MLingualFC: Evaluating Jailbreak Vulnerabilities in Multilingual Vision-Language Models

    Jun 5, 2026Rishabh Makwana, Mamta, Deeksha Varshney +1Multilingual SafetyLarge Language Model Jailbreaks

  44. Membrane: A Self-Evolving Contrastive Safety Memory for LLM Agent Defense

    Jun 4, 2026Minseok Choi, Seungbin Yang, Dongjin Kim +5Large Language Model SafetyJailbreak Attacks

  45. Safety Paradox: How Enhanced Safety Awareness Leaves LLMs Vulnerable to Posterior Attack

    Jun 4, 2026Long P. Hoang, Hai V. Le, Shaoyang Xu +2Large Language Model SafetySafety Alignment

  46. GuardNet: Ensemble Strategies of Shallow Neural Networks for Robust Prompt Injection and Jailbreak Detection

    Jun 4, 2026Paulo Ricardo Ferreira Neves, Edson Rodrigues da Cruz Filho, Paulo Henrique Eleuterio Falsetti +7Prompt-Injection DetectorsJailbreak Attacks

  47. Voices Across Registers: Corpus-Conditioned Vernacular Jailbreaks against Aligned LLMs via Fanfiction Subgenres

    Jun 3, 2026Zhongze Luo, Ruihe Shi, Zhenshuai Yin +3Large Language Model JailbreaksJailbreak Attacks