LLM Backdoor Attacks

LLM: Large Language Model

Latest papers 64

All topics
CardsList
  1. Shared Latent Structures Enable Unified Backdoor Detection and Mitigation in LLMs

    Jun 6, 2026Omar Mahmoud, Aly M. Kassem, Thommen George Karimpanal +4LLM Backdoor AttacksBackdoor Defense in LLMs

  2. Backdoor Unlearning Generalization: A Path Toward the Removal of Unknown Triggers in LLMs

    Jun 2, 2026Lisa Bouger, Théo Lasnier, Philippe Loubet Moundi +2LLM Backdoor AttacksBackdoor Defense in LLMs

  3. Patcher: Post-Hoc Patching of Backdoored Large Language Models

    Jun 2, 2026Anjun Gao, Yueyang Quan, Yufei Xia +2LLM Backdoor AttacksBackdoor Attacks

  4. MemPoison: Bypassing Selective Memory Mechanisms to Plant Backdoors in LLM Agents

    May 28, 2026Hongtao Wang, Se Yang, Yu Chen +1LLM Backdoor AttacksLLM Agent Memory

  5. Position: Retire the "Positive Backdoor" Label -- Secret Alignment Requires Strict and Systematic Evaluation

    May 27, 2026Jianwei Li, Jung-Eun KimLLM Backdoor AttacksLanguage Model Safety Evaluation

  6. Poison with Style: A Practical Poisoning Attack on Code Large Language Models

    May 26, 2026Khang Tran, Yazan Boshmaf, Issa Khalil +3LLM Backdoor AttacksData Poisoning Attacks

  7. Cordyceps: Covert Control Attacks on LLMs via Data Poisoning

    May 26, 2026Zedian Shao, Charles Fleming, Teodora BalutaLLM Backdoor AttacksAdversarial Attacks on LLMs

  8. Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions

    May 24, 2026Wenjuan Li, Yitao Liu, Runze Chen +1LLM Backdoor AttacksLLM Fine-Tuning

  9. PoisonForge: Task-Level Targeted Poisoning Benchmark for Instruction-Tuned LLMs

    May 22, 2026Luze Sun, Anshuman Suri, Harsh Chaudhari +2LLM Safety BenchmarksLLM Backdoor Attacks

  10. Trusted Weights, Treacherous Optimizations? Optimization-Triggered Backdoor Attacks on LLMs

    May 20, 2026Yifei Wang, Yida Yang, Tianlin Li +3LLM Backdoor AttacksBackdoor Attacks

  11. Backdooring Masked Diffusion Language Models

    May 19, 2026Daniel Yiming Cao, Chengzhong Wang, Sheng-Yen Chou +3LLM Backdoor AttacksMasked Diffusion Models

  12. Language-Switching Triggers Take a Latent Detour Through Language Models

    May 18, 2026Francis Kulumba, Wissam Antoun, Théo Lasnier +2LLM Backdoor AttacksMechanistic Interpretability

  13. MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs

    May 14, 2026Rui Wen, Mark Russinovich, Andrew Paverd +2LLM Backdoor AttacksBackdoor Attacks

  14. Widening the Gap: Exploiting LLM Quantization via Outlier Injection

    May 14, 2026Xiaohua Zhan, Kazuki Egashira, Robin Staab +2LLM QuantizationLLM Backdoor Attacks

  15. BadSKP: Backdoor Attacks on Knowledge Graph-Enhanced LLMs with Soft Prompts

    May 12, 2026Xiaoting Lyu, Yufei Han, Hangwei Qian +6LLM Backdoor AttacksKnowledge Augmentation for Language Models

  16. When Emotion Becomes Trigger: Emotion-style dynamic Backdoor Attack Parasitising Large Language Models

    May 12, 2026Ziyu Liu, Tao Li, Tianjie Ni +5LLM Backdoor AttacksBackdoor Attacks

  17. Seed Hijacking of LLM Sampling and Quantum Random Number Defense

    May 8, 2026Ziyang You, Xiaoke Yang, Zhanling Fan +3LLM Backdoor AttacksLLM Security

  18. On the Hardness of Junking LLMs

    May 6, 2026Marco Rando, Samuel VaiterLLM Backdoor AttacksLLM Jailbreak Attacks

  19. On the Privacy of LLMs: An Ablation Study

    May 4, 2026Karima Makhlouf, Lamiaa Basyoni, Syed Khaderi +4LLM Backdoor AttacksMembership Inference Attacks

  20. Defusing the Trigger: Plug-and-Play Defense for Backdoored LLMs via Tail-Risk Intrinsic Geometric Smoothing

    Apr 27, 2026Kaisheng Fan, Weizhe Zhang, Yishu Gao +2LLM Backdoor AttacksBackdoor Defense in LLMs

  21. PermaFrost-Attack: Stealth Pretraining Seeding(SPS) for planting Logic Landmines During LLM Training

    Apr 23, 2026Harsh Kumar, Rahul Maity, Tanmay Joshi +4Language Model PretrainingLLM Backdoor Attacks

  22. Stealthy Backdoor Attacks against LLMs Based on Natural Style Triggers

    Apr 23, 2026Jiali Wei, Ming Fan, Guoheng Sun +3LLM Backdoor AttacksBackdoor Attacks

  23. ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety

    Apr 21, 2026Kun Wang, Cheng Qian, Miao Yu +6LLM Backdoor AttacksMultimodal Large Language Models