Adversarial Prompt Generation

Latest papers 53

All topics
CardsList
  1. ENDOPROMPT: Victim-Side Pseudo-References for Utility Degradation

    Sep 24, 2026Qingyu Wu, Zeyu Feng, Yongda Yu +2Adversarial Prompt GenerationPrompt Injection Attacks

  2. Generating Attacks for LLMs with GFlowNets

    Aug 10, 2026Berkay Ozcam, Irem Onen, Mehmet Fatih Amasyali +1Adversarial Prompt GenerationAdversarial Attacks on LLMs

  3. Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems

    Aug 2, 2026Wanguang Li, Zhaoxin Wang, Handing WangAdversarial Prompt GenerationT2I Generation

  4. Adversarial Prompts for Acceptance Collapse in Speculative Decoding

    Jul 23, 2026Run Wang, Chaoyi Zhou, Xi Liu +7Adversarial Prompt GenerationSpeculative Decoding

  5. Dynamic Defense Profiling Enables Cognitive Jailbreak of Text-to-Image Models

    Jul 20, 2026Dongdong Yang, Deyue Zhang, Zhao Liu +5Adversarial Prompt GenerationAdversarial Examples

  6. Adversarial Prompting Framework for AI Safety Assessment

    Jul 15, 2026Yash Bhatnagar, Kunal Banerjee, Anirban ChatterjeeAdversarial Prompt GenerationAdversarial Attacks on LLMs

  7. Seduced by the Narrative: Assessing Rule Adherence in Semi-Open Textual Sandboxes

    Jul 2, 2026Weiying Chen, Junlong Shen, Zhanyuan Guo +1LLM Safety BenchmarksAdversarial Prompt Generation

  8. Distributed Quality-Diversity Search for Toxicity in Large Language Models

    Jun 23, 2026Onkar Shelar, Travis DesellAdversarial Prompt GenerationLLM Red Teaming

  9. Adversarial Domain Prompt Tuning and Generation for Single Domain Generalization

    Jun 19, 2026Zhipeng Xu, De Cheng, Xinyang Jiang +3Synthetic Data AugmentationAdversarial Prompt Generation

  10. OTTER: A Red-Teaming System for Toxicity-Evading Jailbreak Prompt Optimization

    Jun 19, 2026Jerry Wang, Hsin-Ling Hsu, Yi-Cheng Lai +2Adversarial Prompt GenerationAdversarial Attacks on LLMs

  11. Automated jailbreak attack targeting multiple defense strategies

    Jun 15, 2026Qi Wang, Chengcheng Wan, Weijia He +4Adversarial Prompt GenerationLLM Jailbreak Attacks

  12. GAS-Leak-LLM: Genetic Algorithm-Based Suffix Optimization for Black-Box LLM Jailbreaking

    Jun 14, 2026Aman Anifer, Vignesh Kumar Kembu, Vishnu M +4Adversarial Prompt GenerationLLM Safety

  13. JailbreakOPT: Tool-Assisted Iterative Jailbreak Prompt Optimization

    Jun 9, 2026Ge Shi, Jun Yin, Donglin Xie +3Adversarial Prompt GenerationLarge Language Model-Guided Optimization

  14. Assessing Automated Prompt Injection Attacks in Agentic Environments

    Jun 9, 2026David Hofer, Edoardo Debenedetti, Florian TramèrAdversarial Prompt GenerationLLM Agent Security

  15. Diffuse AI Control on Fuzzy Tasks

    Jun 8, 2026Mikhail Terekhov, Caglar Gulcehre, Vivek Hebbar +1Adversarial Prompt GenerationLanguage Model Safety Evaluation

  16. CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning

    Jun 4, 2026Rahul Markasserithodi, Aditya Joshi, Yuekang Li +3Adversarial TrainingAdversarial Prompt Generation

  17. Voices Across Registers: Corpus-Conditioned Vernacular Jailbreaks against Aligned LLMs via Fanfiction Subgenres

    Jun 3, 2026Zhongze Luo, Ruihe Shi, Zhenshuai Yin +3Adversarial Prompt GenerationLanguage Model Safety Evaluation

  18. Dive into Ambiguity: A*-Inspired Multi-Agents Commonsense Obfuscation Attack on LLM Prompts

    May 31, 2026Boxuan Wang, Zhuoyun Li, Xiaowei Huang +1Adversarial Prompt GenerationAdversarial Attacks

  19. Automatically Attacking Software Reverse Engineering AI Agents

    May 28, 2026Brian Crawford, Justin Phillips, Patrick McClureSoftware EngineeringAdversarial Prompt Generation

  20. Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills

    May 28, 2026Chia-Yi Hsu, Chia-Mu Yu, Chun-Ying Huang +1Adversarial Prompt GenerationAI Coding Agents

  21. Evolving and Detecting Multi-Turn Deception using Geometric Signatures

    May 26, 2026Surender Suresh Kumar, Mary L. CummingsAdversarial Prompt GenerationDeception in Language Models

  22. Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models

    May 25, 2026Arian Komaei Koma, Seyed Amir Kasaei, AmirMahdi Sadeghzadeh +1Adversarial Prompt GenerationAdversarial Attacks

  23. LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models

    May 20, 2026Abdullah Al Nomaan Nafi, Fnu Suya, Swarup Bhunia +1Adversarial Prompt GenerationLLM Jailbreak Attacks

  24. PQR: A Framework to Generate Diverse and Realistic User Queries that Elicit QA Agent Failures

    May 15, 2026Yunan Lu, Luigi Liu, Omar Yahia +2AI Agent ReliabilityAdversarial Prompt Generation

  25. The Great Pretender: A Stochasticity Problem in LLM Jailbreak

    May 14, 2026Jean-Philippe Monteuuis, Cong Chen, Jonathan PetitLLM Safety BenchmarksLLM Evaluation

  26. LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs

    May 13, 2026Rodrigo Nogueira, Thales Sales Almeida, Giovana Kerche Bonás +7Adversarial Prompt GenerationLLM Guardrails

  27. Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation

    May 12, 2026Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed +1Adversarial TrainingAdversarial Prompt Generation

  28. The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring

    May 9, 2026Ismail Hossain, Tanzim Ahad, Md Jahangir Alam +3Adversarial Prompt GenerationLanguage Model Safety Evaluation

  29. LLM-Agnostic Semantic Representation Attack

    May 9, 2026Jiawei Lian, Jianhong Pan, Lefan Wang +4Adversarial Prompt GenerationAdversarial Attacks on LLMs

  30. OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing

    May 8, 2026Jianming Chen, Yawen Wang, Junjie Wang +3Adversarial Prompt GenerationT2I Generation

  31. PersonaTeaming: Supporting Persona-Driven Red-Teaming for Generative AI

    May 7, 2026Wesley Hanwen Deng, Mingxi Yan, Sunnie S. Y. Kim +5Adversarial Prompt GenerationLLM Red Teaming

  32. MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

    May 3, 2026Jialin Song, Xiaodong Liu, Weiwei Yang +4LLM Safety BenchmarksAdversarial Prompt Generation

  33. A Theoretical Game of Attacks via Compositional Skills

    May 1, 2026Xinbo Wu, Huan Zhang, Abhishek Umrawal +1Adversarial Prompt GenerationAdversarial Attacks on LLMs

  34. SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts

    Apr 29, 2026Yuan Xin, Yixuan Weng, Minjun Zhu +5Adversarial TrainingAdversarial Prompt Generation

  35. Adaptive Prompt Embedding Optimization for LLM Jailbreaking

    Apr 27, 2026Miles Q. Li, Benjamin C. M. Fung, Boyang Li +2Adversarial Prompt GenerationAdversarial Attacks on LLMs

  36. Agentic Adversarial Rewriting Exposes Architectural Vulnerabilities in Black-Box NLP Pipelines

    Apr 26, 2026Mazal Bethany, Kim-Kwang Raymond Choo, Nishant Vishwamitra +1Fake News DetectionAdversarial Prompt Generation

  37. CAP-CoT: Cycle Adversarial Prompt for Improving Chain of Thoughts in LLM Reasoning

    Apr 25, 2026Shuxu Chen, Yitian Zhou, Jiaquan Zhang +6Adversarial Prompt GenerationLLM Prompting

  38. Adaptive Instruction Composition for Automated LLM Red-Teaming

    Apr 22, 2026Jesse Zymet, Andy Luo, Swapnil Shinde +2Adversarial Prompt GenerationLLM Red Teaming

  39. EvoJail: Evolutionary Diverse Jailbreak Prompt Generation for Large Language Models

    Apr 22, 2026Rui Tang, Kaiyu Xu, Pengsen Cheng +3Adversarial Prompt GenerationLLM Jailbreak Attacks

  40. Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing

    Apr 17, 2026Zehao Wang, Lanjun WangAdversarial Prompt GenerationJailbreak Attacks

  41. Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization

    Apr 16, 2026Haochun Tang, Yuliang Yan, Jiahua Lu +2Adversarial Prompt GenerationCost-Aware Inference

  42. T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search

    Mar 21, 2026Hyomin Lee, Sangwoo Park, Yumin Choi +3Adversarial Prompt GenerationLLM Red Teaming

  43. "Give a Positive Review Only": An Early Investigation Into In-Paper Prompt Injection Attacks and Defenses for AI Reviewers

    Nov 3, 2025Qin Zhou, Zhexin Zhang, Zhi Li +1Adversarial Prompt GenerationIndirect Prompt Injection

  44. NonTextual Target Attack

    Oct 3, 2025Xinzhe Huang, Wenjing Hu, Tianhang Zheng +6Adversarial Prompt GenerationAdversarial Attacks on LLMs

  45. RedCoder: Automated Multi-Turn Red Teaming for Code LLMs

    Jun 25, 2025Wenjie Jacky Mo, Qin Liu, Xiaofei Wen +5Adversarial Prompt GenerationLLM Red Teaming

  46. Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models

    Mar 8, 2025Thomas Winninger, Boussad Addad, Katarzyna KapustaAdversarial Prompt GenerationAdversarial Attacks on LLMs