Adversarial Attacks on LLMs

LLM: Large Language Model

Latest papers 238

All topics
CardsList
  1. One Year Later...The Harms Persist, But So Do We!

    Jun 22, 2026Annika Marie Schoene, Cansu Canca, Gautham Vijay Kumar +1Mental HealthAdversarial Attacks on LLMs

  2. The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs

    Jun 21, 2026Shivam Ratnakar, Kartikeya VatsLanguage Model SteeringAdversarial Attacks on LLMs

  3. Safe to Check, Unsafe to Use: Relinking at the Compression Boundary of LLM Agents

    Jun 19, 2026Zesen Liu, Zihan Zhang, Dongdong SheAdversarial Attacks on LLMsLLM Agent Security

  4. OTTER: A Red-Teaming System for Toxicity-Evading Jailbreak Prompt Optimization

    Jun 19, 2026Jerry Wang, Hsin-Ling Hsu, Yi-Cheng Lai +2Adversarial Prompt GenerationAdversarial Attacks on LLMs

  5. Analyzing the Narration Gap in LLM-Solver Loops

    Jun 17, 2026Zunchen Huang, Songgaojun DengAdversarial Attacks on LLMsFormal Verification

  6. FragFuse: Bypassing Access Control of Large Language Model Agents via Memory-Based Query Fragmentation and Fusion

    Jun 14, 2026Zixin Rao, Wentian Zhu, Chan Aristella Lu +5Adversarial Attacks on LLMsLLM Agent Security

  7. From Shield to Target: Denial-of-Service Attacks on LLM-Based Agent Guardrails

    Jun 12, 2026Yuguang Zhou, Xunguang Wang, Pingchuan Ma +3LLM GuardrailsAdversarial Attacks on LLMs

  8. It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO

    Jun 9, 2026Naihao Deng, Yilun Zhu, Naichen Shi +2LLM AlignmentSocial Bias in Language Models

  9. Game-Theoretic Multi-Agent Control for Robust Contextual Reasoning in LLMs

    Jun 9, 2026Saeid Jamshidi, Amin Nikanjam, Arghavan Moradi Dakhel +2Adversarial Attacks on LLMsMulti-Agent Control

  10. Gaming AI-Assisted Peer Reviews Poses New Risks to the Scientific Community

    Jun 8, 2026Lin Li, Qi Zhang, Xander Davies +2Adversarial AttacksAdversarial Attacks on LLMs

  11. Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO

    Jun 8, 2026Blake Bullwinkel, Eugenia Kim, Amanda Minnich +1Adversarial TrainingAdversarial Attacks on LLMs

  12. Now You (Still) See Me: Detecting Evasive Steganographic Payloads in LLMs

    Jun 8, 2026Charles Westphal, Timothy Douglas, Keivan Navaie +2LLM Backdoor AttacksAdversarial Attacks on LLMs

  13. Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks

    Jun 6, 2026Haoming Wen, Shi Chen, Qingyu Shi +4Adversarial TrainingLLM Alignment

  14. RecurGuard: Runtime Monitoring for Reasoning-Token Consumption Attacks

    Jun 6, 2026Abid Aziz, Hafsa Binte KibriaAdversarial Attacks on LLMsLLM Security

  15. Steering Vectors are an Adversarial Attack Surface

    Jun 4, 2026Abzal Aidakhmetov, Donato Crisostomi, Tommaso Mencattini +3Language Model SteeringAdversarial Attacks on LLMs

  16. Consistency Training Along the Transformer Stack

    Jun 4, 2026Sukrati Gautam, Neil Shah, Arav Dhoot +7Adversarial Attacks on LLMsLLM Safety Alignment

  17. Safety Paradox: How Enhanced Safety Awareness Leaves LLMs Vulnerable to Posterior Attack

    Jun 4, 2026Long P. Hoang, Hai V. Le, Shaoyang Xu +2Adversarial Attacks on LLMsLLM Safety Alignment

  18. CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning

    Jun 4, 2026Rahul Markasserithodi, Aditya Joshi, Yuekang Li +3Adversarial TrainingAdversarial Prompt Generation