LLM Backdoor Attacks

LLM: Large Language Model

Latest papers 64

All topics
CardsList
  1. Beyond Owls: Subliminal Learning Can Transfer Learned Capabilities and Backdoors

    Oct 7, 2026Jan Dubiński, Anna Sztyber-Betley, Jan Betley +1Subliminal LearningKnowledge Distillation

  2. The Model Plants the Trigger: Answer-Side Backdoor Attacks in Multi-Turn Large Language Models

    Oct 6, 2026Yibo Zhang, Tianrong Guan, Liang Lin +3LLM Backdoor AttacksBackdoor Attacks

  3. Does On-Policy Distillation for Safety Pose Backdoor Risks?

    Oct 6, 2026Jian Luo, Kehan Qi, Qingqiao Hu +5LLM Backdoor AttacksLLM Security

  4. Backdooring Sparse Autoencoders

    Oct 5, 2026Enrico Ahlers, Daniel Passon, Tobias Kiecker +2LLM Backdoor AttacksAdversarial Attacks

  5. Topology-Conditioned Backdoors: Language Models That Insert Vulnerabilities When They Infer They Are in a Multi-Agent System

    Oct 5, 2026Keegan Wang, Anantika MannbyLLM Backdoor AttacksAI Agent Auditing

  6. Hidden Risks of Jev: An Empirical Study of Security, Privacy, and Dual Use

    Oct 4, 2026Shang Wang, Tianqing Zhu, Huajie Chen +3LLM Backdoor AttacksModel Extraction Attacks

  7. Backdoor Purification for LoRA-Tuned LLMs via Null-Space Projection

    Sep 30, 2026Jianwei Li, Jung-Eun KimLLM Backdoor AttacksBackdoor Defense in LLMs

  8. Backdoor Containment via Expert Quarantine and Shutdown in LLMs

    Sep 30, 2026Jianwei Li, Min-Seon Kim, Jung-Eun KimLLM Backdoor AttacksBackdoor Defense in LLMs

  9. Don't Inoculate Everything: Stratified Inoculation Prompting Narrows Backdoor Triggers and Preserves Desired Traits

    Sep 28, 2026Kajetan Dymkiewicz, Tim Farrelly, Adam Prada +7LLM Backdoor AttacksBackdoor Defense in LLMs

  10. Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks

    Sep 14, 2026Aashiq Muhamed, Mona T. Diab, Virginia Smith +2LLM Backdoor AttacksBackdoor Attacks

  11. When Explanations Betray Backdoors: Black-Box Auditing for Language Model Classifiers

    Aug 12, 2026Yang Liu, Ran ZouLLM Backdoor AttacksBackdoor Detection

  12. Backdoor Decontamination Dynamics in LLM Agents

    Aug 11, 2026Gabriel Huang, Abhay Puri, Léo Boisvert +4LLM Backdoor AttacksBackdoor Defense in LLMs

  13. ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills via Coupled Trigger-Rule Optimization

    Aug 10, 2026Hao Sui, Simeng Qin, Jie Liao +3LLM Backdoor AttacksLLM Agent Security

  14. LoRAScan: Detecting Backdoor Prompts in Low-Rank Adapters for Large Language Models via Down-Projection Activation Spikes

    Aug 7, 2026Doniyorkhon Obidov, Honggang Yu, Xiaolong Guo +1LLM Backdoor AttacksBackdoor Detection

  15. Evading Chain-of-Thought Monitoring Through Model Poisoning

    Aug 3, 2026Giorgio Severi, Shujaat Mirza, Blake Bullwinkel +1LLM Backdoor AttacksLLM Auditing

  16. ToxScreen: Detecting Whether an LLM Has Been Poisoned

    Jul 29, 2026Anthony Hughes, Nicole Xing, Collin Francel +2LLM Backdoor AttacksBackdoor Detection

  17. Early Detection of Distributed Backdoors in Multi-Agent LLM Systems: A Characterization Study

    Jul 27, 2026Diego Fernandez Arias, Dev Prashant Mistry, Ren Wang +1Multi-Agent LLM SystemsLLM Backdoor Attacks

  18. Defense Against LLM Backdoors using Critical Neuron Isolation Pruning

    Jul 22, 2026Yuxi Li, Zhibo Zhang, Kailong Wang +3LLM Backdoor AttacksBackdoor Defense in LLMs

  19. Beware What You Autocomplete: Forensic Attribution of Backdoored Code Completions

    Jul 9, 2026Anjun Gao, Yueyang Quan, Zhuqing Liu +1LLM Backdoor AttacksBackdoor Detection

  20. CSO-LLM: Class Subspace Orthogonalization for Post-Training Backdoor Detection and Trigger Inversion in LLMs

    Jun 30, 2026Zhengxing Li, David J. Miller, Guangmingmei Yang +1LLM Backdoor AttacksBackdoor Detection

  21. Fuzzing Large Language Models to Elicit Hidden Behaviours

    Jun 28, 2026Mohammed Abu Baker, Lakshmi Babu-SaheerLLM Backdoor AttacksLLM Auditing

  22. FlipGuard: Defending Large Language Models Against Quantization-Conditioned Backdoor Attacks

    Jun 27, 2026Aoying Zheng, Anqi Du, Zizhuang Deng +1LLM QuantizationLLM Backdoor Attacks

  23. FloatDoor: Platform-Triggered Backdoors in LLMs

    Jun 17, 2026Nils Loose, Jonas Sander, Felix Mächtle +1LLM Backdoor AttacksBackdoor Attacks

  24. Rapid Poison: Practical Poisoning Attacks Against the Rapid Response Framework

    Jun 15, 2026David Huang, Jaewon Chang, Avidan Shah +2LLM Backdoor AttacksPrompt Injection Attacks

  25. Dummy Backdoor as a Defense: Removing Unknown Backdoors via Shared Internal Mechanisms for Generative LLMs

    Jun 10, 2026Kazuki Iwahana, Masaru Matsubayashi, Takuma Koyama +3LLM Backdoor AttacksBackdoor Defense in LLMs

  26. Now You (Still) See Me: Detecting Evasive Steganographic Payloads in LLMs

    Jun 8, 2026Charles Westphal, Timothy Douglas, Keivan Navaie +2LLM Backdoor AttacksAdversarial Attacks on LLMs