Adversarial Attacks on LLMs

LLM: Large Language Model

Latest papers 238

All topics
CardsList
  1. Test-Time Training Undermines Safety Guardrails

    May 21, 2026Simone Antonelli, Sadegh Akhondzadeh, Aleksandar BojchevskiLanguage Model Safety EvaluationAdversarial Attacks on LLMs

  2. Latent-space Attacks for Refusal Evasion in Language Models

    May 20, 2026Giorgio Piras, Raffaele Mura, Fabio Brau +4Adversarial Attacks on LLMsLLM Safety

  3. How Far Will They Go? Red-Teaming Online Influence with Large Language Models

    May 20, 2026Daniel C. Ruiz, Anna Serbina, Ashwin Rao +2Language Model SteeringLLM Auditing

  4. Detecting Fluent Optimization-Based Adversarial Prompts via Sequential Entropy Changes

    May 19, 2026Mohammed Alshaalan, Miguel R. D. RodriguesAdversarial Attacks on LLMsJailbreak Detection

  5. Attention-Guided Reward for Reinforcement Learning-based Jailbreak against Large Reasoning Models

    May 19, 2026Zheng Lin, Zhenxing Niu, Haoxuan Ji +2Adversarial Attacks on LLMsLLM Jailbreak Attacks

  6. Adaptive Probe-based Steering for Robust LLM Jailbreaking

    May 19, 2026Junxi Chen, Junhao Dong, Xiaohua XieLanguage Model SteeringAdversarial Attacks on LLMs

  7. When Efficiency Backfires: Cascading LLMs Trigger Cascade Failure under Adversarial Attack

    May 17, 2026Zehan Sun, Dingfan Chen, Songze LiAdversarial Attacks on LLMsLLM Security

  8. Propagating Unsafe Actions in LLM Controlled Multi-Robot Collaboration via Single Robot Compromise

    May 15, 2026Zhen Huang, Zhihuang Liu, Mengxuan Luo +2Large Language Model-Based Robot PlanningAdversarial Attacks on LLMs

  9. Widening the Gap: Exploiting LLM Quantization via Outlier Injection

    May 14, 2026Xiaohua Zhan, Kazuki Egashira, Robin Staab +2LLM QuantizationLLM Backdoor Attacks

  10. Talk is (Not) Cheap: A Taxonomy and Benchmark Coverage Audit for LLM Attacks

    May 14, 2026Karthik Raghu Iyer, Yazdan Jamshidi, Nicholas Bray +1LLM Safety BenchmarksBenchmark Auditing

  11. A Few Steps Further: Why Defenses Against Malicious Finetuning Erode Under Continued Training

    May 14, 2026Itay Zloczower, Eyal Lenga, Gilad Gressel +1Language Model Safety EvaluationAdversarial Attacks on LLMs

  12. Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding

    May 13, 2026Shuoyang Sun, Chang Dai, Hao Fang +6Adversarial Attacks on LLMsSpeculative Decoding

  13. Model-Agnostic Lifelong LLM Safety via Externalized Attack-Defense Co-Evolution

    May 13, 2026Xiaozhe Zhang, Chaozhuo Li, Hui Liu +4Continual Learning for LLMsAdversarial Attacks on LLMs

  14. Inducing Overthink: Hierarchical Genetic Algorithm-based DoS Attack on Black-Box Large Language Reasoning Models

    May 13, 2026Shuqiang Wang, Wei Cao, Jiaqi Weng +4Overthinking in Language ModelsAdversarial Attacks on LLMs

  15. Adaptive Steering and Remasking for Safe Generation in Diffusion Language Models

    May 13, 2026Yejin Lee, Ungsik Kim, Yo-Sub HanAdversarial Attacks on LLMsDiffusion Language Model Inference

  16. Not Just RLHF: Why Alignment Alone Won't Fix Multi-Agent Sycophancy

    May 13, 2026Adarsh Kumarappan, Ananya MujooAI Agent ReliabilityMulti-Agent LLM Systems

  17. CoT-Guard: Small Models for Strong Monitoring

    May 12, 2026Nirav Diwan, Han Wang, Berkcan Kapusuzoglu +6LLM AuditingAdversarial Attacks on LLMs

  18. Metaphor Is Not All Attention Needs

    May 12, 2026Olga Sorokoletova, Francesco Giarrusso, Giacomo De Luca +6Adversarial Attacks on LLMsJailbreak Attacks

  19. Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning

    May 12, 2026Chi Zhang, Haibo Qiu, Qiming Zhang +3RL for Language Model ReasoningAdversarial Attacks on LLMs

  20. Comment and Control: Hijacking Agentic Workflows via Context-Grounded Evolution

    May 11, 2026Neil Fendley, Zhengyu Liu, Aonan Guan +2Adversarial Attacks on LLMsAgentic Workflows

  21. PRISM: Generation-Time Detection and Mitigation of Secret Leakage in Multi-Agent LLM Pipelines

    May 11, 2026Riya Tapwal, Abhishek Kumar, Carsten MapleData LeakageMulti-Agent LLM Systems

  22. Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization

    May 11, 2026Huilin Zhou, Jian Zhao, Yilu Zhong +7Inference-Time OptimizationAdversarial Attacks on LLMs

  23. FragBench: Cross-Session Attacks Hidden in Benign-Looking Fragments

    May 10, 2026Astha Mehta, Niruthiha Selvanayagam, Cedric Lam +10LLM Safety BenchmarksLanguage Model Safety Evaluation

  24. LLM-Agnostic Semantic Representation Attack

    May 9, 2026Jiawei Lian, Jianhong Pan, Lefan Wang +4Adversarial Prompt GenerationAdversarial Attacks on LLMs

  25. OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM Agents

    May 9, 2026Xinyu Li, Ronghui Mu, Lin Li +2Adversarial Attacks on LLMsLLM Red Teaming

  26. A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models

    May 8, 2026Hamid Kazemi, Atoosa Chegini, Maria SafiLLM InterpretabilityAdversarial Attacks on LLMs

  27. The Attacker in the Mirror: Breaking Self-Consistency in Safety via Anchored Bipolicy Self-Play

    May 8, 2026Gabriele La Malfa, Emanuele La Malfa, Saar Cohen +4Self-Play RLLanguage Model Safety Evaluation

  28. A Systematic Investigation of RL-Jailbreaking in LLMs

    May 7, 2026Montaser Mohammedalamen, Kevin Roice, Reginald McLean +1Language Model Safety EvaluationAdversarial Attacks on LLMs

  29. LoopTrap: Termination Poisoning Attacks on LLM Agents

    May 7, 2026Huiyu Xu, Zhibo Wang, Wenhui Zhang +4Adversarial Attacks on LLMsLLM Red Teaming