Adversarial Prompts

Latest papers 54

All topics
CardsList
  1. Harmful Content Generation in Text-to-Image Models: Capabilities and Moderation Limitations

    Oct 5, 2026Paschalis Giakoumoglou, Manos Schinas, Symeon PapadopoulosModern Text-To-Image ModelsChild Sexual Abuse Material

  2. Safe Image Generation via Reinforcement Learning

    Oct 5, 2026Eungyeol Han, Jong-Seok LeeAdversarial Prompts

  3. Gaussian Core LoRA: Distribution-Aware Dynamic Adaptation for Broad Concept Erasure

    Sep 1, 2026Qinghui Gong, Xunlei Chen, Yu-Xuan Zhang +2Concept ErasureAdversarial Prompts

  4. Not an A11y: How Android Accessibility Exposes Mobile AI Agents to Indirect Prompt Injection

    Aug 9, 2026Rahul Deivasigamani, Sayeda Faatin Alvi, Derqui Andrea +2Artificial Intelligence AgentsDevice

  5. STEMMA: An Adversarial Multi-Agent Framework for Evaluating Self-Identity Consistency in LLMs

    Aug 8, 2026Nuthakki Siva Gopala Krishna, Kanishka JainKnowledge DistillationAdversarial Prompts

  6. Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation

    Aug 5, 2026Ye Leng, Junjie Chu, Yiting Qu +3Hate SpeechHate Speech Detection

  7. Test-Time Scaling for Safe Text-Guided Image Generation via Intermediate Clean Estimates

    Aug 4, 2026Jinya Sakurai, Shueicheng Yan, Xun XuText-To-Image Diffusion ModelsText-To-Image

  8. Training-Free versus Training-Based Intent Classification in LLMs: Accuracy, Robustness, and Failure Modes

    Aug 3, 2026Nan Chen, Zhouhao Yang, Soufiane HayouTraining-FreeAdversarial Prompts

  9. Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems

    Aug 2, 2026Wanguang Li, Zhaoxin Wang, Handing WangAdversarial PromptsJailbreak Success Rates

  10. Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

    Jul 27, 2026Xinnuo Xu, Anja Thieme, Daniela Massiceti +6ToxicityAdversarial Prompts

  11. Adversarial Prompts for Acceptance Collapse in Speculative Decoding

    Jul 23, 2026Run Wang, Chaoyi Zhou, Xi Liu +7Speculative DecodingAdversarial Prompts

  12. Dynamic Defense Profiling Enables Cognitive Jailbreak of Text-to-Image Models

    Jul 20, 2026Dongdong Yang, Deyue Zhang, Zhao Liu +5Adversarial PromptsJailbreak Success Rates

  13. Adversarial Prompting Framework for AI Safety Assessment

    Jul 15, 2026Yash Bhatnagar, Kunal Banerjee, Anirban ChatterjeeAdversarial PromptsArtificial Intelligence Safety

  14. Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs

    Jul 8, 2026Anupam Wagle, Ifrat Ikhtear Uddin, Chaowei Zhang +1Large Language Model JailbreaksAdversarial Prompts

  15. MPSelectTune: Prompt-type Selection for Fine-tuning improves Concept Unlearning in LLMs

    Jul 4, 2026Shubhadip Nag, Srinjoy Das, Agniva Saha +5Large Language Model UnlearningAdversarial Prompts

  16. kNNGuard: Turning LLM Hidden Activations into a Training-Free Configurable Guardrail

    Jul 2, 2026Mahmoud Abdelfattah, Hamid Nasiri, Peter GarraghanLarge Language Model SafetyAdversarial Prompts

  17. Concept Removal Guidance: Evidence-Calibrated Negative Guidance for Safe Diffusion Sampling

    Jun 29, 2026Yoonseok Choi, Chaeyoung Oh, Hyunjun Choi +2Text-To-Image Diffusion ModelsAdversarial Prompts

  18. Concept Removal for Frontier Image Generative Models

    Jun 24, 2026Aditya Kumar, Pierre Joly, Adam Dziedzic +1Text-To-Image Diffusion ModelsDiffusion Models

  19. A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

    Jun 24, 2026Abrar Alotaibi, Raed Mughus, Moataz AhmedLarge Language Model ReliabilityRed-Teaming

  20. Adversarial Creation and Detection of AI-Generated Social Bot Content

    Jun 5, 2026Mykola Trokhymovych, Ricardo Baeza-Yates, Alessandro Flammini +2Ai-Generated Content DetectionGenerative Artificial Intelligence

  21. IDEAFix: Evaluation Framework for Creative Defixation Prompting in LLMs

    May 30, 2026F. Carichon, S. Sharma, M. Girard +2CreativityLarge Language Model Generation

  22. SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents

    May 27, 2026Yubin Qu, Yi Liu, Gelei Deng +4Coding AgentsSynthetic Environments

  23. Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security

    May 27, 2026Xiang Fang, Wanlong FangAdversarial PromptsLarge Language Model Safety

  24. PAST2HARM: A Simple Adaptive Past Tense Attack for Jailbreaking Multimodal AI

    May 26, 2026Snehasis MukhopadhyayAdversarial PromptsHarms

  25. Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models

    May 25, 2026Arian Komaei Koma, Seyed Amir Kasaei, AmirMahdi Sadeghzadeh +1Text-To-Image Diffusion ModelsAdversarial Prompts

  26. Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection

    May 24, 2026Lixing Lin, Juli You, Yue Li +4Large Language Model SafetyAdversarial Prompts

  27. Detecting Fluent Optimization-Based Adversarial Prompts via Sequential Entropy Changes

    May 19, 2026Mohammed Alshaalan, Miguel R. D. RodriguesAdversarial PromptsToken-Level Entropy

  28. The Evaluation Game: Beyond Static LLM Benchmarking

    May 19, 2026Paul Wang, Jade Garcia-Bourrée, Anne-Marie Kermarrec +1Adversarial EvaluationAdversarial Prompts

  29. Empty SPACE: Cross-Attention Sparsity for Concept Erasure in Diffusion Models

    May 11, 2026Nicola Novello, Andrea M. TonelloConcept ErasureText-To-Image Diffusion Models

  30. When Prompts Become Payloads: A Framework for Mitigating SQL Injection Attacks in Large Language Model-Driven Applications

    May 11, 2026Farzad Nourmohammadzadeh Motlagh, Mehrdad Hajizadeh, Mehryar Majd +3Instruction Injection AttacksText-To-Sql

  31. The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring

    May 9, 2026Ismail Hossain, Tanzim Ahad, Md Jahangir Alam +3Jailbreak AttacksJailbreaks

  32. LLM-Agnostic Semantic Representation Attack

    May 9, 2026Jiawei Lian, Jianhong Pan, Lefan Wang +4Attacker Large Language ModelAdversarial Prompts

  33. PersonaTeaming: Supporting Persona-Driven Red-Teaming for Generative AI

    May 7, 2026Wesley Hanwen Deng, Mingxi Yan, Sunnie S. Y. Kim +5Red-TeamingHuman-Ai Collaboration

  34. XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity

    May 7, 2026Dasol Choi, Eugenia Kim, Jaewon Noh +14Large Language Model SafetyCultural Awareness

  35. On the Hardness of Junking LLMs

    May 6, 2026Marco Rando, Samuel VaiterLarge Language Model JailbreaksJailbreak Attacks

  36. Self-Mined Hardness for Safety Fine-Tuning

    May 4, 2026Prakhar Gupta, Garv Shah, Donghua ZhangLarge Language Model JailbreaksJailbreaks

  37. MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

    May 3, 2026Jialin Song, Xiaodong Liu, Weiwei Yang +4Large Language Model SafetyJailbreak Attacks

  38. A Theoretical Game of Attacks via Compositional Skills

    May 1, 2026Xinbo Wu, Huan Zhang, Abhishek Umrawal +1Attacker Large Language ModelAdversarial Prompts

  39. SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts

    Apr 29, 2026Yuan Xin, Yixuan Weng, Minjun Zhu +5Peer ReviewAdversarial Prompts

  40. CAP-CoT: Cycle Adversarial Prompt for Improving Chain of Thoughts in LLM Reasoning

    Apr 25, 2026Shuxu Chen, Yitian Zhou, Jiaquan Zhang +6Adversarial PromptsLLM Reasoning Strategies

  41. Reverse Constitutional AI: A Framework for Controllable Toxic Data Generation via Probability-Clamped RLAIF

    Apr 20, 2026Yuan Fang, Yiming Luo, Aimin Zhou +1Adversarial PromptsToxicity

  42. Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence

    Apr 9, 2026Niklas Herbster, Martin Zborowski, Alberto Tosato +2Adversarial Prompts

  43. T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search

    Mar 21, 2026Hyomin Lee, Sangwoo Park, Yumin Choi +3Attacker Large Language ModelRed-Teaming

  44. Selective Fine-Tuning for Targeted and Robust Concept Unlearning

    Feb 8, 2026Mansi, Avinash Kori, Francesca Toni +1Adversarial PromptsDiffusion Models

  45. LoRAShield: Data-Free Editing Alignment for Secure Personalized LoRA Sharing

    Jul 5, 2025Jiahao Chen, Junhao Li, Yiming Wang +6Adversarial PromptsText-To-Image Diffusion Models

  46. ROTATE: Regret-driven Open-ended Training for Ad Hoc Teamwork

    May 29, 2025Caroline Wang, Arrasy Rahman, Benjamin Nativi +4Heterogeneous Robot TeamsAdversarial Prompts

  47. VLMGuard: Bootstrapping Malicious Prompt Detectors from Unlabeled Vision-Language Prompts in the Wild

    Oct 1, 2024Junlin Fang, Wenyu Chen, Reshmi Ghosh +7Adversarial PromptsMultiple Prompt Learning Frameworks