Adversarial Prompt Generation

Latest papers 55

All topics
CardsList
  1. ENDOPROMPT: Victim-Side Pseudo-References for Utility Degradation

    Sep 24, 2026Qingyu Wu, Zeyu Feng, Yongda Yu +2Adversarial Prompt GenerationPrompt Injection Attacks

  2. ASCII Attack: Recontextualising Harmful Requests as Artistic Critique in Large Language Models

    Sep 2, 2026Da Cheng Gu, Yifei Dong, Xinghao Yang +2LLM Jailbreak AttacksLLM Safety Evaluation

  3. Breadth Beats Depth: Improving GCG-Based Jailbreak Optimization with Breadth-Oriented Suffix Search

    Sep 2, 2026Shiliang Xiao, Jingsong Wei, Yuzhi Liang +3LLM Jailbreak AttacksAdversarial Prompt Generation

  4. Generating Attacks for LLMs with GFlowNets

    Aug 10, 2026Berkay Ozcam, Irem Onen, Mehmet Fatih Amasyali +1Adversarial Prompt GenerationAdversarial Attacks on LLMs

  5. Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems

    Aug 2, 2026Wanguang Li, Zhaoxin Wang, Handing WangAdversarial Prompt GenerationT2I Generation

  6. Adversarial Prompts for Acceptance Collapse in Speculative Decoding

    Jul 23, 2026Run Wang, Chaoyi Zhou, Xi Liu +7Adversarial Prompt GenerationSpeculative Decoding

  7. Dynamic Defense Profiling Enables Cognitive Jailbreak of Text-to-Image Models

    Jul 20, 2026Dongdong Yang, Deyue Zhang, Zhao Liu +5Adversarial Prompt GenerationAdversarial Examples

  8. Adversarial Prompting Framework for AI Safety Assessment

    Jul 15, 2026Yash Bhatnagar, Kunal Banerjee, Anirban ChatterjeeAdversarial Prompt GenerationAdversarial Attacks on LLMs

  9. Seduced by the Narrative: Assessing Rule Adherence in Semi-Open Textual Sandboxes

    Jul 2, 2026Weiying Chen, Junlong Shen, Zhanyuan Guo +1LLM Safety BenchmarksAdversarial Prompt Generation

  10. Distributed Quality-Diversity Search for Toxicity in Large Language Models

    Jun 23, 2026Onkar Shelar, Travis DesellAdversarial Prompt GenerationLLM Red Teaming

  11. Adversarial Domain Prompt Tuning and Generation for Single Domain Generalization

    Jun 19, 2026Zhipeng Xu, De Cheng, Xinyang Jiang +3Synthetic Data AugmentationAdversarial Prompt Generation

  12. OTTER: A Red-Teaming System for Toxicity-Evading Jailbreak Prompt Optimization

    Jun 19, 2026Jerry Wang, Hsin-Ling Hsu, Yi-Cheng Lai +2Adversarial Prompt GenerationAdversarial Attacks on LLMs

  13. Automated jailbreak attack targeting multiple defense strategies

    Jun 15, 2026Qi Wang, Chengcheng Wan, Weijia He +4Adversarial Prompt GenerationLLM Jailbreak Attacks

  14. GAS-Leak-LLM: Genetic Algorithm-Based Suffix Optimization for Black-Box LLM Jailbreaking

    Jun 14, 2026Aman Anifer, Vignesh Kumar Kembu, Vishnu M +4Adversarial Prompt GenerationLLM Safety

  15. JailbreakOPT: Tool-Assisted Iterative Jailbreak Prompt Optimization

    Jun 9, 2026Ge Shi, Jun Yin, Donglin Xie +3Adversarial Prompt GenerationLarge Language Model-Guided Optimization

  16. Assessing Automated Prompt Injection Attacks in Agentic Environments

    Jun 9, 2026David Hofer, Edoardo Debenedetti, Florian TramèrAdversarial Prompt GenerationLLM Agent Security

  17. Diffuse AI Control on Fuzzy Tasks

    Jun 8, 2026Mikhail Terekhov, Caglar Gulcehre, Vivek Hebbar +1Adversarial Prompt GenerationLanguage Model Safety Evaluation

  18. CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning

    Jun 4, 2026Rahul Markasserithodi, Aditya Joshi, Yuekang Li +3Adversarial TrainingAdversarial Prompt Generation

  19. Voices Across Registers: Corpus-Conditioned Vernacular Jailbreaks against Aligned LLMs via Fanfiction Subgenres

    Jun 3, 2026Zhongze Luo, Ruihe Shi, Zhenshuai Yin +3Adversarial Prompt GenerationLanguage Model Safety Evaluation

  20. Dive into Ambiguity: A*-Inspired Multi-Agents Commonsense Obfuscation Attack on LLM Prompts

    May 31, 2026Boxuan Wang, Zhuoyun Li, Xiaowei Huang +1Adversarial Prompt GenerationAdversarial Attacks

  21. Automatically Attacking Software Reverse Engineering AI Agents

    May 28, 2026Brian Crawford, Justin Phillips, Patrick McClureSoftware EngineeringAdversarial Prompt Generation

  22. Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills

    May 28, 2026Chia-Yi Hsu, Chia-Mu Yu, Chun-Ying Huang +1Adversarial Prompt GenerationAI Coding Agents

  23. Evolving and Detecting Multi-Turn Deception using Geometric Signatures

    May 26, 2026Surender Suresh Kumar, Mary L. CummingsAdversarial Prompt GenerationDeception in Language Models

  24. Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models

    May 25, 2026Arian Komaei Koma, Seyed Amir Kasaei, AmirMahdi Sadeghzadeh +1Adversarial Prompt GenerationAdversarial Attacks