Prompt Injection Attacks on LLMs

LLM: Large Language Model

Latest papers 95

All topics
CardsList
  1. RoguePrompt: Dual-Layer Encoding for Self-Reconstruction to Circumvent LLM Moderation

    Jul 29, 2026Benyamin Tafreshian, Prathamesh DhakeAdversarial AttacksAdversarial Attacks on LLMs

  2. GPT-Red: Automated Red Teaming via Self-Play at Scale

    Jul 28, 2026Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal +15Adversarial TrainingLLM Red Teaming

  3. Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents

    Jul 22, 2026Or Zion Eliav, Eyal Lenga, Shir Bernstien +1AI Agent SecurityAI Agent Security Benchmarks

  4. CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization

    Jul 21, 2026Xinting Liao, Behnoosh Zamanlooy, Masoumeh Shafieinejad +4LLM SecurityPrompt Injection Defense

  5. Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems

    Jul 16, 2026Soham Gadgil, David Alexander, Sai Sunku +1AI Agent SecurityAgent Memory Poisoning

  6. NetInjectBench: Benchmarking Indirect Prompt Injection in Tool-Using Large Language Model Agents for Network Operations

    Jul 11, 2026Ruksat Khan Shayoni, Muhammad Faraz Shoaib, S M Asif Hossain +1AI Agent Security BenchmarksIndirect Prompt Injection

  7. Agent Data Injection Attacks are Realistic Threats to AI Agents

    Jul 6, 2026Woohyuk Choi, Juhee Kim, Taehyun Kang +3AI Agent SecurityIndirect Prompt Injection

  8. DualView: Preventing Indirect Prompt Injection in Personal AI Agents

    Jul 4, 2026Juhee Kim, Woohyuk Choi, Taehyun Kang +2LLM Agent SecurityIndirect Prompt Injection

  9. Security--Fidelity Tradeoffs: The Hidden Cost of Prompt Injection Defense

    Jun 29, 2026Mitchell Hermon, Rahul Gupta, Weitong Ruan +2LLM Safety BenchmarksPrompt Injection Defense

  10. Prompt Injection in Automated Résumé Screening with Large Language Models: Single and Multi-Injection Settings

    Jun 25, 2026Preet Baxi, Jiannan Xu, Jane Yi Jiang +1Algorithmic FairnessPrompt Injection Attacks

  11. GIF: Locally Sound Geometric Information Flow Control for LLMs

    Jun 22, 2026Adam Storek, Nikolaus Holzer, Zhuo Zhang +1Privacy Leakage in Language ModelsLLM Security

  12. Confidently Wrong: Severity-Aware Calibration of Prompt-Injection Detectors under Attack Shift

    Jun 21, 2026Md Anas BiswasIndirect Prompt InjectionModel Calibration

  13. A Layered Security Framework Against Prompt Injection in RAG-Based Chatbots

    Jun 17, 2026Gulshan Saleem, Nisar Ahmed, Muhammad Imran Zaman +1LLM GuardrailsIndirect Prompt Injection

  14. SafeClawBench: Separating Semantic, Audit-Evidence, and Sandbox Harm in Tool-Using LLM Agents

    Jun 16, 2026Yuchuan Tian, Mengyu Zheng, Haocheng Mei +5LLM Safety BenchmarksLLM Agent Security

  15. Automated jailbreak attack targeting multiple defense strategies

    Jun 15, 2026Qi Wang, Chengcheng Wan, Weijia He +4Adversarial Prompt GenerationLLM Jailbreak Attacks

  16. Defending against Adaptive Prompt Injection Attacks via Reasoning-enabled Task Alignment

    Jun 13, 2026Lipeng He, Yihan Wang, Jiawen Zhang +1Adversarial TrainingAI Agent Safety

  17. AutoDojo: A Generative Benchmark for Evaluating Prompt Injection Defenses in LLM Agents

    Jun 13, 2026Xinhang Ma, Taoran Li, Chaowei Xiao +3AI Agent Security BenchmarksIndirect Prompt Injection

  18. PI-Hunter: Automated Red-Teaming for Exposing and Localizing Prompt Injections

    Jun 10, 2026Pengfei He, Lesly Miculicich, Vishesh Sharma +5AI Agent AuditingLLM Auditing

  19. Assessing Automated Prompt Injection Attacks in Agentic Environments

    Jun 9, 2026David Hofer, Edoardo Debenedetti, Florian TramèrAdversarial Prompt GenerationLLM Agent Security

  20. Game-Theoretic Multi-Agent Control for Robust Contextual Reasoning in LLMs

    Jun 9, 2026Saeid Jamshidi, Amin Nikanjam, Arghavan Moradi Dakhel +2Adversarial Attacks on LLMsMulti-Agent Control

  21. GitInject: Real-World Prompt Injection Attacks in AI-Powered CI/CD Pipelines

    Jun 7, 2026Jafar Isbarov, Umid Suleymanov, Ilia Shumailov +1AI Agent SecurityAI Agent Security Benchmarks

  22. GuardNet: Ensemble Strategies of Shallow Neural Networks for Robust Prompt Injection and Jailbreak Detection

    Jun 4, 2026Paulo Ricardo Ferreira Neves, Edson Rodrigues da Cruz Filho, Paulo Henrique Eleuterio Falsetti +7LLM GuardrailsNeural Network Robustness