Backdoor Defense in LLMs

LLM: Large Language Model

Latest papers 22

All topics
CardsList
  1. Backdoor Purification for LoRA-Tuned LLMs via Null-Space Projection

    Sep 30, 2026Jianwei Li, Jung-Eun KimLLM Backdoor AttacksBackdoor Defense in LLMs

  2. Backdoor Containment via Expert Quarantine and Shutdown in LLMs

    Sep 30, 2026Jianwei Li, Min-Seon Kim, Jung-Eun KimLLM Backdoor AttacksBackdoor Defense in LLMs

  3. Don't Inoculate Everything: Stratified Inoculation Prompting Narrows Backdoor Triggers and Preserves Desired Traits

    Sep 28, 2026Kajetan Dymkiewicz, Tim Farrelly, Adam Prada +7LLM Backdoor AttacksBackdoor Defense in LLMs

  4. Universal Defenses for Tool-Integrated LLM Agents Against Adversarial Attacks

    Sep 14, 2026Xiaoyan Li, Yunli WangAdversarial Attacks on LLMsBackdoor Defense in LLMs

  5. SpecGuard: Inference-Time Backdoor Detection For Free

    Sep 11, 2026Rui Wen, Ahmed Salem, Andrew Paverd +2Backdoor DetectionBackdoor Defense in LLMs

  6. When Explanations Betray Backdoors: Black-Box Auditing for Language Model Classifiers

    Aug 12, 2026Yang Liu, Ran ZouLLM Backdoor AttacksBackdoor Detection

  7. Backdoor Decontamination Dynamics in LLM Agents

    Aug 11, 2026Gabriel Huang, Abhay Puri, Léo Boisvert +4LLM Backdoor AttacksBackdoor Defense in LLMs

  8. LoRAScan: Detecting Backdoor Prompts in Low-Rank Adapters for Large Language Models via Down-Projection Activation Spikes

    Aug 7, 2026Doniyorkhon Obidov, Honggang Yu, Xiaolong Guo +1LLM Backdoor AttacksBackdoor Detection

  9. ToxScreen: Detecting Whether an LLM Has Been Poisoned

    Jul 29, 2026Anthony Hughes, Nicole Xing, Collin Francel +2LLM Backdoor AttacksBackdoor Detection

  10. Defense Against LLM Backdoors using Critical Neuron Isolation Pruning

    Jul 22, 2026Yuxi Li, Zhibo Zhang, Kailong Wang +3LLM Backdoor AttacksBackdoor Defense in LLMs

  11. FlipGuard: Defending Large Language Models Against Quantization-Conditioned Backdoor Attacks

    Jun 27, 2026Aoying Zheng, Anqi Du, Zizhuang Deng +1LLM QuantizationLLM Backdoor Attacks

  12. Dummy Backdoor as a Defense: Removing Unknown Backdoors via Shared Internal Mechanisms for Generative LLMs

    Jun 10, 2026Kazuki Iwahana, Masaru Matsubayashi, Takuma Koyama +3LLM Backdoor AttacksBackdoor Defense in LLMs

  13. Shared Latent Structures Enable Unified Backdoor Detection and Mitigation in LLMs

    Jun 6, 2026Omar Mahmoud, Aly M. Kassem, Thommen George Karimpanal +4LLM Backdoor AttacksBackdoor Defense in LLMs

  14. Backdoor Unlearning Generalization: A Path Toward the Removal of Unknown Triggers in LLMs

    Jun 2, 2026Lisa Bouger, Théo Lasnier, Philippe Loubet Moundi +2LLM Backdoor AttacksBackdoor Defense in LLMs

  15. Patcher: Post-Hoc Patching of Backdoored Large Language Models

    Jun 2, 2026Anjun Gao, Yueyang Quan, Yufei Xia +2LLM Backdoor AttacksBackdoor Attacks

  16. Defusing the Trigger: Plug-and-Play Defense for Backdoored LLMs via Tail-Risk Intrinsic Geometric Smoothing

    Apr 27, 2026Kaisheng Fan, Weizhe Zhang, Yishu Gao +2LLM Backdoor AttacksBackdoor Defense in LLMs

  17. UniGuardian: A Unified Defense for Detecting Prompt Injection, Backdoor Attacks and Adversarial Attacks in Large Language Models

    Feb 18, 2025Huawei Lin, Yingjie Lao, Tony Geng +2LLM Backdoor AttacksAdversarial Attacks on LLMs