Multi-Turn Jailbreak Attacks

Momentum

0 papers in the last four weeks, against 2 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 22

All topics
CardsList
  1. Before the Script, Set the Stage: How Worldview Simulation Amplifies Psychologically Grounded Persuasion in Multi-Turn Jailbreaking

    Sep 2, 2026Siyu Chen, Haoran Wang, Xiaojian Li +3Multi-Turn Jailbreak AttacksLLM Safety Evaluation

  2. MJ: Multi-turn LLM Jailbreaking via Decomposed Credit Assignment

    Jul 13, 2026Junyoung Park, Namgyu Park, Sechan Lee +3RL for Language ModelsLLM Jailbreak Attacks

  3. ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm

    Jul 11, 2026Kefan Song, Yanjun QiAI Agent AuditingLLM Auditing

  4. Context-Fractured Decomposition Attacks on Tool-Using LLM Agents: Exploiting Artifact Provenance Gaps

    Jun 8, 2026Xiaofeng Lin, Yukai Yang, Daniel Guo +3Jailbreak AttacksLLM Agent Security

  5. THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models

    Jun 1, 2026Zhiqing Ma, Zhonghao Xu, Dong Yu +3LLM SafetyMulti-Turn Jailbreak Attacks

  6. D-Judge: Disrupting Multi-Turn Jailbreaks using Semantics-Preserving Output Rewriting

    May 31, 2026Huanli Gong, Zhipeng Wei, Yu Fu +4LLM GuardrailsMulti-Turn Jailbreak Attacks

  7. Evolving and Detecting Multi-Turn Deception using Geometric Signatures

    May 26, 2026Surender Suresh Kumar, Mary L. CummingsAdversarial Prompt GenerationDeception in Language Models

  8. BAIT: Boundary-Guided Disclosure Escalation LLM Jailbreaking via Self-Conditioned Reasoning

    May 26, 2026Xuan Luo, Yue Wang, Geng Tu +2Jailbreak AttacksLLM Safety

  9. MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks

    May 10, 2026Xinkai Zhang, Zhipeng Wei, Huanli Gong +4Language Model Safety EvaluationJailbreak Attacks

  10. Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking

    May 9, 2026Zhida He, Xiaoyu Wen, Han Qi +7RL for Language ModelsCredit Assignment in RL

  11. Mitigating Many-shot Jailbreak Attacks with One Single Demonstration

    May 8, 2026Kejia Chen, Jiawen Zhang, Boheng Li +6Jailbreak AttacksIn-Context Learning

  12. One Turn Too Late: Learning When to Intervene Against Multi-Turn Malicious Intent

    May 7, 2026Xinjie Shen, Rongzhe Wei, Peizhi Niu +6Language Model Safety EvaluationLLM Guardrails

  13. ContextualJailbreak: Evolutionary Red-Teaming via Simulated Conversational Priming

    May 4, 2026Mario Rodríguez Béjar, Francisco J. Cortés-Delgado, S. Braghin +1Evolutionary OptimizationLLM Red Teaming

  14. MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

    May 3, 2026Jialin Song, Xiaodong Liu, Weiwei Yang +4LLM Safety BenchmarksAdversarial Prompt Generation

  15. Jailbreaking Frontier Foundation Models Through Intention Deception

    Apr 27, 2026Xinhe Wang, Katia Sycara, Yaqi XieJailbreak AttacksLLM Safety

  16. SafeDream: Safety World Model for Proactive Early Jailbreak Detection

    Apr 18, 2026Bo Yan, Weikai Lin, Yada Zhu +1Language Model Safety EvaluationWorld Models

  17. Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks

    Oct 16, 2025Trilok Padhi, Pinxian Lu, Abdulkadir Erol +5Adversarial Attacks on LLMsAI Agent Security Benchmarks