Adversarial Attacks on LLMs

LLM: Large Language Model

Latest papers 238

All topics
CardsList
  1. When Choices Become Risks: Safety Failures of Large Language Models under Multiple-Choice Constraints

    Apr 18, 2026Yuheng Chen, Zhiyu Wu, Bowen Cheng +2Adversarial Attacks on LLMsLLM Safety Alignment

  2. Stochasticity in Tokenisation Improves Robustness

    Apr 17, 2026Sophie Steger, Rui Li, Sofiane Ennadir +4Adversarial Attacks on LLMsNeural Network Robustness

  3. Conjunctive Prompt Attacks in Multi-Agent LLM Systems

    Apr 17, 2026Nokimul Hasan Arif, Qian Lou, Mengxin ZhengMulti-Agent LLM SystemsAdversarial Attacks on LLMs

  4. Jailbreak Scaling Laws for Large Language Models: Polynomial-Exponential Crossover

    Mar 11, 2026Indranil Halder, Annesya Banerjee, Cengiz PehlevanAdversarial Attacks on LLMsPrompt Injection Attacks on LLMs

  5. Prompt Injection as Role Confusion

    Feb 22, 2026Charles Ye, Jasmine Cui, Dylan Hadfield-MenellAdversarial Attacks on LLMsPrompt Injection Attacks

  6. Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges

    Feb 14, 2026Ruomeng Ding, Yifei Pang, He Sun +3LLM AlignmentLLM-as-a-Judge

  7. Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs

    Jan 29, 2026Xiang Zheng, Yutao Wu, Hanxun Huang +5Prompt InjectionAI Coding Agents

  8. In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement

    Jan 19, 2026Anudeex Shetty, Aditya Joshi, Salil S. KanhereLanguage Model Safety EvaluationAdversarial Attacks on LLMs

  9. Safety Is Not Universal: The Selective Safety Trap in LLM Alignment

    Jan 7, 2026Iago Alves Brito, Walcy Santos Rezende Rios, Julia Soares Dollis +2LLM Safety BenchmarksLLM Alignment

  10. Hidden State Poisoning Attacks against Mamba-based Language Models

    Jan 5, 2026Alexandre Le Mercier, Chris Develder, Thomas DemeesterAdversarial Attacks on LLMsLanguage Modeling

  11. Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks

    Oct 16, 2025Trilok Padhi, Pinxian Lu, Abdulkadir Erol +5Adversarial Attacks on LLMsAI Agent Security Benchmarks

  12. Are LLMs Reliable Rankers? Rank Manipulation via Two-Stage Token Optimization

    Oct 8, 2025Tiancheng Xing, Jerry Li, Yixuan Du +1Adversarial Attacks on LLMsLLM Reranking

  13. NonTextual Target Attack

    Oct 3, 2025Xinzhe Huang, Wenjing Hu, Tianhang Zheng +6Adversarial Prompt GenerationAdversarial Attacks on LLMs

  14. Data Security in Large Language Models: Risks, Defense, and Directions

    Aug 4, 2025Kang Chen, Xiuze Zhou, Yuanhui Yu +4Adversarial Attacks on LLMsLLM Security

  15. Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

    Jun 9, 2025Mickel Liu, Liwei Jiang, Yancheng Liang +4Self-Play RLAdversarial Attacks on LLMs

  16. HauntAttack: When Attack Follows Reasoning as a Shadow

    Jun 8, 2025Jingyuan Ma, Rui Li, Zheng Li +4Adversarial Attacks on LLMsJailbreak Attacks

  17. Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models

    Mar 8, 2025Thomas Winninger, Boussad Addad, Katarzyna KapustaAdversarial Prompt GenerationAdversarial Attacks on LLMs

  18. UniGuardian: A Unified Defense for Detecting Prompt Injection, Backdoor Attacks and Adversarial Attacks in Large Language Models

    Feb 18, 2025Huawei Lin, Yingjie Lao, Tony Geng +2LLM Backdoor AttacksAdversarial Attacks on LLMs

  19. Divide and Conquer: A Hybrid Strategy Defeats Multimodal Large Language Models

    Dec 21, 2024Yanxu Mao, Peipei Liu, Tiehan Cui +3Adversarial Attacks on LLMsMultimodal Large Language Models

  20. Learning diverse attacks on large language models for robust red-teaming and safety tuning

    May 28, 2024Seanie Lee, Minsu Kim, Lynn Cherif +8Adversarial Attacks on LLMsLLM Red Teaming

  21. A False Average: Pooled CoT-Monitor Accuracy Conceals a Reasoning-Dependent Fragility

    Date pendingShikhar Shiromani, Leo RichterReward HackingAdversarial Attacks on LLMs

  22. Whitewashing Hate, Smearing Harmless Content: Annotator-Style Rebuttal Attacks on LLM-Based Moderation

    Date pendingJunyu Lu, Kaiyuan Liu, Kaichun Wang +8Content ModerationAdversarial Attacks on LLMs