LLM Defense Mechanisms

Momentum

32 papers in the last four weeks, up 256% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 258

All topics
CardsList
  1. The Proxy Knows Too Much: Sealing LLM API Routers with Attested TEEs

    Jun 15, 2026Sipeng Xie, Qianhong Wu, Hengrun Lu +4Large Language Model RoutingLLM Defense Mechanisms

  2. Shielded Analysis: Certification and Characterization of Defensibility in Systems under Adversarial Interaction

    Jun 11, 2026Achraf Hsain, Sultan AlmuhammadiLLM Defense MechanismsProbabilistic Safety

  3. VOID: Defeating Unauthorized Mimicry in Latent Diffusion Models

    Jun 10, 2026Chunlin Qiu, Ang Li, Tianxiao Huang +7Latent Diffusion ModelLLM Defense Mechanisms

  4. Reinforcement Learning Disrupts Gradient-Based Adversarial Optimization

    Jun 10, 2026Xinhai Zou, Chang Zhao, Alireza Aghabagherloo +3Gradient-Based AttacksAdversarial Training

  5. Toward Trustworthy AI: Multi-Target Adversarial Attacks and Robust Defenses for Continuous Data Summarization

    Jun 10, 2026Yuefang Lian, Longkun Guo, Zhongrui Zhao +5Black-Box Adversarial AttacksTrustworthy Artificial Intelligence

  6. SAIGuard: Communication-State Simulation for Proactive Defense of LLM Multi-Agent Systems

    Jun 10, 2026Ruxue Shi, Yili Wang, Mengnan Du +4Model-Based Multi-Agent SystemsLLM Defense Mechanisms

  7. Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO

    Jun 8, 2026Blake Bullwinkel, Eugenia Kim, Amanda Minnich +1Red-TeamingLLM Defense Mechanisms

  8. GitInject: Real-World Prompt Injection Attacks in AI-Powered CI/CD Pipelines

    Jun 7, 2026Jafar Isbarov, Umid Suleymanov, Ilia Shumailov +1Indirect Prompt InjectionAi-Based

  9. Beyond Homophily: Towards Generalized Graph Reconstruction Attack and Defense

    Jun 6, 2026Zhanke Zhou, Bo Han, Xuan Li +3Graph Neural NetworksText-Attributed Graph

  10. Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks

    Jun 6, 2026Haoming Wen, Shi Chen, Qingyu Shi +4Model Fine-TuningLLM Defense Mechanisms

  11. SHIELD-IDS: Structurally Heterogeneous Ensemble with Integrated Layered Defense for Intrusion Detection Systems

    Jun 5, 2026Maryam Zaman, Muhammad Khuram ShahzadIntrusion DetectionDistributed Denial-Of-Service

  12. Didact: A Cross-Domain Capability Discovery System for Defence

    Jun 5, 2026Aarya Bodhankar, Aditya Joshi, Bao Gia Doan +3DiscoveryKnowledge Graphs

  13. Adversarial Attacks Already Tell the Answer: Directional Bias-Guided Test-time Defense for Vision-Language Models

    Jun 4, 2026Liangsheng Liu, Si Chen, Jiamin Wu +5LLM Defense Mechanisms

  14. Hybrid Adversarial Defence for Natural Language Understanding Tasks

    Jun 3, 2026Manar Abouzaid, Yang Wang, Chenghua Lin +1Attacker Large Language ModelLLM Defense Mechanisms

  15. Toward a Generalized Defense Across Sparse, Continuous, and Structured Parameter Attacks

    Jun 3, 2026Bin Duan, Zeyu Bai, Guowei YangModel-Agnostic DefenseBlack-Box Adversarial Attacks

  16. Beyond False Stability: High-Noise Drift Gating for Test-Time Adversarial Defenses in Vision-Language Models

    Jun 2, 2026Hashmat Shadab Malik, Muzammal Naseer, Salman KhanAdversarial TrainingContrastive Language-Image Pre-Training Model

  17. Detecting Aimbot Cheaters in MOGs

    Jun 2, 2026Salman Shaikh, Tao Ni, Marc DacierLLM Defense Mechanisms

  18. FlowGuard: Flow Matching for Identity-Independent Detection of Data-Free Model Stealing Attacks on Energy System Intrusion Detection Systems

    Jun 2, 2026Maxime Schwarzer, Laurin Holz, Tobias Huerten +4Intrusion DetectionLLM Defense Mechanisms

  19. AI Model Extraction Attacks: Bypassing Single-Client Assumptions in Defenses

    Jun 2, 2026Maxime Schwarzer, Johannes F. Loevenich, Gustavo Sánchez +5Realistic Threat ModelLLM Defense Mechanisms

  20. Repurposing Adversarial Perturbations for Continual Learning: From Defense to Active Alignment

    Jun 1, 2026Ran Liu, Min Yu, Mingqi Liu +7Replay-Based Continual LearningContinual Learning

  21. SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning

    Jun 1, 2026Lichao Wang, Zhaoxing Ren, Tianzhuo Yang +4Large Language Model SafetyLLM Defense Mechanisms

  22. THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models

    Jun 1, 2026Zhiqing Ma, Zhonghao Xu, Dong Yu +3Large Language Model JailbreaksJailbreak Attacks

  23. BraveGuard: From Open-World Threats to Safer Computer-Use Agents

    May 31, 2026Yunhao Feng, Xiaohu Du, Xinhao Deng +13LLM Defense MechanismsComputer-Use Agents

  24. D-Judge: Disrupting Multi-Turn Jailbreaks using Semantics-Preserving Output Rewriting

    May 31, 2026Huanli Gong, Zhipeng Wei, Yu Fu +4Jailbreak AttacksLLM Defense Mechanisms

  25. LinguIUTics at PsyDefDetect: Iterative Imbalance-Aware Fine-tuning of Qwen3-8B for Psychological Defense Mechanism Classification

    May 30, 2026Shefayat E Shams Adib, Ahmed Alfey Sani, Md Hasibur Rahman Alif +1LLM Defense MechanismsQwen3

  26. "I Strongly Suspect This Website Is a Scam": Benchmarking PII Leakage and Detection without Defense in Autonomous Web Agents

    May 30, 2026Soham Roy, Sarthakbrata Halder, Arya Bharaty +5Web AgentsData Leakage

  27. EvoDefense: Co-Evolving Black-Box Defense with Large Language Models

    May 29, 2026Yu Li, Yuenan Hou, Yingmei Wei +2Attacker Large Language ModelLLM Defense Mechanisms

  28. Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense

    May 29, 2026Shuhao Zhang, Jiarui Li, Qi Cao +2Prompt-Injection DetectorsLLM Defense Mechanisms

  29. Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security

    May 27, 2026Xiang Fang, Wanlong FangAdversarial PromptsLarge Language Model Safety

  30. Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks

    May 26, 2026Kevin Kuo, Virginia Smith, Chhavi YadavAttacker Large Language ModelLarge Language Model Fine-Tuning

  31. Security of OpenClaw Agents: Fundamentals, Attacks, and Countermeasures

    May 25, 2026Yuntao Wang, Jianle Ba, Han Liu +5OpenclawSecurity

  32. Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions

    May 24, 2026Wenjuan Li, Yitao Liu, Runze Chen +1Large Language Model Fine-TuningModel Fine-Tuning

  33. Overview of the PsyDefDetect Shared Task at BioNLP 2026: Detecting Levels of Psychological Defense Mechanisms in Supportive Conversations

    May 24, 2026Hongbin Na, Zimu Wang, Zhaoming Chen +8Natural Language ProcessingLLM Defense Mechanisms

  34. IterInject: Indirect Prompt Injection Against LLM Agents via Feedback-Guided Iterative Optimization

    May 23, 2026Zixuan Chen, Jiaxiang Chen, Li Luo +4Indirect Prompt InjectionLarge Language Model Agents

  35. Demystifying the Mythos or Disrupting Bugonomics? From Zero-Day Asymmetry to Defender Remediation Throughput

    May 23, 2026Alfredo Pesoli, Herman Errico, Lorenzo CavallaroModel VulnerabilitiesRemediation

  36. Self-supervised Adversarial Purification for Graph Neural Networks

    May 22, 2026Woohyun Lee, Hogun ParkGraph Neural NetworksGraph Representations

  37. Dithering Defense: Adversarial Robustness of Vision Foundation Models via Multi-Level Floyd-Steinberg Dithering

    May 21, 2026Yury Belousov, Brian Pulfer, Vitaliy Kinakh +1Recent Vision Foundation ModelsVision Foundation Models

  38. The Distillation Game: Adaptive Attacks & Efficient Defenses

    May 21, 2026Youssef Allouah, Mahdi Haghifam, Sanmi Koyejo +1Distribution Matching DistillationLLM Defense Mechanisms

  39. DEFLECT: Temporal Counterfactual Preference Learning for Delay-Robust Asynchronous VLAs

    May 19, 2026Yixiang Zhu, Yonghao Chen, Zijie Yang +2Counterfactual LearningInference Latency

  40. Active Defense Against False Data Injection Attacks in Robotic Manipulators

    May 18, 2026Gabriele Gualandi, Carl Mikael Larsson, Alessandro V. PapadopoulosRobotic ManipulatorRobust Control