Adversarial Prompt Generation

Latest papers 55

All topics
CardsList
  1. LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models

    May 20, 2026Abdullah Al Nomaan Nafi, Fnu Suya, Swarup Bhunia +1Adversarial Prompt GenerationLLM Jailbreak Attacks

  2. PQR: A Framework to Generate Diverse and Realistic User Queries that Elicit QA Agent Failures

    May 15, 2026Yunan Lu, Luigi Liu, Omar Yahia +2AI Agent ReliabilityAdversarial Prompt Generation

  3. The Great Pretender: A Stochasticity Problem in LLM Jailbreak

    May 14, 2026Jean-Philippe Monteuuis, Cong Chen, Jonathan PetitLLM Safety BenchmarksLLM Evaluation

  4. LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs

    May 13, 2026Rodrigo Nogueira, Thales Sales Almeida, Giovana Kerche Bonás +7Adversarial Prompt GenerationLLM Guardrails

  5. Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation

    May 12, 2026Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed +1Adversarial TrainingAdversarial Prompt Generation

  6. The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring

    May 9, 2026Ismail Hossain, Tanzim Ahad, Md Jahangir Alam +3Adversarial Prompt GenerationLanguage Model Safety Evaluation

  7. LLM-Agnostic Semantic Representation Attack

    May 9, 2026Jiawei Lian, Jianhong Pan, Lefan Wang +4Adversarial Prompt GenerationAdversarial Attacks on LLMs

  8. OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing

    May 8, 2026Jianming Chen, Yawen Wang, Junjie Wang +3Adversarial Prompt GenerationT2I Generation

  9. PersonaTeaming: Supporting Persona-Driven Red-Teaming for Generative AI

    May 7, 2026Wesley Hanwen Deng, Mingxi Yan, Sunnie S. Y. Kim +5Adversarial Prompt GenerationLLM Red Teaming

  10. MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

    May 3, 2026Jialin Song, Xiaodong Liu, Weiwei Yang +4LLM Safety BenchmarksAdversarial Prompt Generation

  11. A Theoretical Game of Attacks via Compositional Skills

    May 1, 2026Xinbo Wu, Huan Zhang, Abhishek Umrawal +1Adversarial Prompt GenerationAdversarial Attacks on LLMs

  12. SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts

    Apr 29, 2026Yuan Xin, Yixuan Weng, Minjun Zhu +5Adversarial TrainingAdversarial Prompt Generation

  13. Adaptive Prompt Embedding Optimization for LLM Jailbreaking

    Apr 27, 2026Miles Q. Li, Benjamin C. M. Fung, Boyang Li +2Adversarial Prompt GenerationAdversarial Attacks on LLMs

  14. Agentic Adversarial Rewriting Exposes Architectural Vulnerabilities in Black-Box NLP Pipelines

    Apr 26, 2026Mazal Bethany, Kim-Kwang Raymond Choo, Nishant Vishwamitra +1Fake News DetectionAdversarial Prompt Generation

  15. CAP-CoT: Cycle Adversarial Prompt for Improving Chain of Thoughts in LLM Reasoning

    Apr 25, 2026Shuxu Chen, Yitian Zhou, Jiaquan Zhang +6Adversarial Prompt GenerationLLM Prompting

  16. Adaptive Instruction Composition for Automated LLM Red-Teaming

    Apr 22, 2026Jesse Zymet, Andy Luo, Swapnil Shinde +2Adversarial Prompt GenerationLLM Red Teaming

  17. EvoJail: Evolutionary Diverse Jailbreak Prompt Generation for Large Language Models

    Apr 22, 2026Rui Tang, Kaiyu Xu, Pengsen Cheng +3Adversarial Prompt GenerationLLM Jailbreak Attacks

  18. Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing

    Apr 17, 2026Zehao Wang, Lanjun WangAdversarial Prompt GenerationJailbreak Attacks

  19. Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization

    Apr 16, 2026Haochun Tang, Yuliang Yan, Jiahua Lu +2Adversarial Prompt GenerationCost-Aware Inference

  20. T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search

    Mar 21, 2026Hyomin Lee, Sangwoo Park, Yumin Choi +3Adversarial Prompt GenerationLLM Red Teaming

  21. "Give a Positive Review Only": An Early Investigation Into In-Paper Prompt Injection Attacks and Defenses for AI Reviewers

    Nov 3, 2025Qin Zhou, Zhexin Zhang, Zhi Li +1Adversarial Prompt GenerationIndirect Prompt Injection

  22. NonTextual Target Attack

    Oct 3, 2025Xinzhe Huang, Wenjing Hu, Tianhang Zheng +6Adversarial Prompt GenerationAdversarial Attacks on LLMs

  23. RedCoder: Automated Multi-Turn Red Teaming for Code LLMs

    Jun 25, 2025Wenjie Jacky Mo, Qin Liu, Xiaofei Wen +5Adversarial Prompt GenerationLLM Red Teaming

  24. Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models

    Mar 8, 2025Thomas Winninger, Boussad Addad, Katarzyna KapustaAdversarial Prompt GenerationAdversarial Attacks on LLMs