LLM Defense Mechanisms

Momentum

32 papers in the last four weeks, up 256% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 258

All topics
CardsList
  1. Defensive Sufficiency in a Stackelberg Model of AI Security

    Oct 7, 2026Subhabrata Majumdar, Rajlakshmi ChavanLLM Defense Mechanisms

  2. Where Rules End and Judges Begin: Measuring the Judgment Boundary in Multi-Agent Systems Security

    Oct 6, 2026Shaswata Mitra, Raj Patel, Subash Neupane +3LLM Defense Mechanisms

  3. Mapping the RAG Landscape: A Four Axis Taxonomy of Efficiency, Defense, Interactivity, and Reasoning

    Oct 1, 2026Meghana Sunil, Shravya V, Shravan Venkatraman +1Retrieval-Augmented Generation PipelinesInteractivity

  4. MOMAT: Mixture of Multiple Atlases for Low-Power Jailbreak Defense of Quantized LLMs

    Oct 1, 2026Boyang Li, Bingyu Shen, Weihao Hong +6Large Language Model QuantizationJailbreak Success Rates

  5. Safer Content or Firmer Refusals? A Hybrid Perturbation Defense for Alignment under Harmful Fine-tuning

    Sep 29, 2026Muhammad Zeeshan Akram, Mufid Kamel Marican, Anvesh Reddy Yenugu +2Model-Agnostic DefenseLarge Language Model Safety

  6. DecoyTrace: Toxic Decoys for Active Defense in Decentralized Federated Learning

    Sep 28, 2026Pedro Beltrán-López, Enrique Tomás Martínez Beltrán, Pantaleone Nespoli +2Federated LearningModel-Agnostic Defense

  7. Distillation Defenses Easily Break After Reinforcement Learning

    Sep 28, 2026Shidan Javaheri, Alexander Panfilov, Oliver Britton +2Probe-Logit DistillationLLM Defense Mechanisms

  8. SEAD: A State-Based Perspective on Attack and Defense in Tool-Using Agents

    Sep 28, 2026Xinjie Shen, Junran Wang, Rongzhe Wei +1LLM Defense MechanismsIncomplete Evidence

  9. Similarity Is Not Validity: Defending LLM Semantic Caches Against Poisoning

    Sep 28, 2026Zihan Zhang, Shuangjie Yao, Zesen Liu +8PoisoningAttacker Large Language Model

  10. A Computer Vision Approach to Visual Fraud Detection in Phishing Websites Using YOLOv8

    Sep 27, 2026Basil Sajid Shaikh, Hajar HomayouniPhishingFraud Detection

  11. LLM4Trust: Exploring the Capabilities of Large Language Models for Trust Evaluation

    Sep 27, 2026Jie Wang, Yanbo Sun, Zheng Yan +2AI TrustworthinessLog-Ratio-Based Gaussian Trust Weight

  12. ZeroGAR: Benchmarking the Adversarial Robustness of Zero-Shot Graph Models

    Sep 27, 2026Zhongjian Zhang, Xiao Wang, Busheng Zhang +5Zero-Shot RobustnessLLM Defense Mechanisms

  13. Benchmarking Argumentative Behaviour of LLMs: A Study of Defences Against Character Attacks

    Sep 23, 2026Ewelina Gajewska, Katarzyna Budzynska, Jaroslaw ChudziakLarge Language Model DecisionsArgumentation Frameworks

  14. Persistent Billable State: Denial-of-Wallet Attacks and Defenses in Tool-Calling LLM Agents

    Sep 23, 2026Jinqian Zhang, Haojun Xia, Shujiang Wu +4LLM Defense Mechanisms

  15. Toward Responsible AI-Augmented Cyber Defense: Pattern Recognition, Defense-in-Depth, and the Case for Human-AI Collaboration

    Sep 22, 2026Mustafa S. Aljumaily, Hayder Kareem Abed, Nawar S. AlseelawiHuman-Ai CollaborationLLM Defense Mechanisms

  16. Learning Defensive Policies against Diverse Inference Attacks for Smart Meter Privacy

    Sep 21, 2026Ruichang Zhang, Mustafa A. MustafaMembership Inference AttacksLLM Defense Mechanisms

  17. Nameless Tokenization: A Lossless Tokenizer-Level Defense Against Control-Token Forgery in Open-Weight LLMs

    Sep 15, 2026Kisu Yang, Yoonna Jang, Heuiseok LimLLM Defense MechanismsEncoders

  18. Universal Defenses for Tool-Integrated LLM Agents Against Adversarial Attacks

    Sep 14, 2026Xiaoyan Li, Yunli WangAttacker Large Language ModelLLM Defense Mechanisms

  19. RAG-CT: Mitigating Privacy Risks on Retrieval-Augmented Generation Systems via Scanning Prompt Distribution

    Sep 14, 2026Xingyu Lyu, Jiayimei Wang, Jianfeng He +3PrivacyLLM Defense Mechanisms

  20. SALUTE: Benchmarking and Adapting LLMs for the Defense Domain

    Sep 14, 2026Hyeongcheol Park, Sumin In, Suyeon Myeong +5Large Language Model AdaptationLLM Defense Mechanisms

  21. PIDS-Bench: Evaluating Prompt-Injection Detectors Under Over-Defense, Obfuscation, and Distribution Shift

    Sep 14, 2026Yusuf Khalid Shire, Sang-Chul KimPrompt-Injection DetectorsModel-Agnostic Defense

  22. Fed-Equilibrium Framework for Topological Pareto Control in Robust and Fair Clinical Federated Learning

    Sep 14, 2026Ting Xu, Henry LeungFederated LearningEquilibrium

  23. Deep-Fake CAPTCHA: Mitigating Next-Generation Social Engineering Attacks

    Sep 12, 2026Guy Frankovits, Lior Yasur, Fred M. Grabovski +1Deepfake DetectionAuthenticity

  24. Beyond Benchmarks: Using VLMs to Reveal Systematic Classification Failures Under Real World Conditions

    Sep 12, 2026Dieuwertje Alblas, Alma M. Liezenga, Jan Erik van Woerden +3LLM Defense MechanismsReal-World

  25. Architecting the Secure AI-SOC: A Neurosymbolic Framework for Pipeline Integrity and Threat Mitigation

    Sep 12, 2026Anna Gazani, Spyridon Kounoupidis, Panagiotis Katsaros +3Indirect Prompt InjectionCyber Threat Intelligence

  26. CMNIE: An Information Extraction Benchmark for Chinese Military News

    Sep 11, 2026Yan Yu, Mengna Zhu, Zhenyu Song +3Relation ExtractionHeadlines

  27. Active Adaptation, Not Static Defense: Temporal Dynamics of Preventative Steering in Adversarial Fine-Tuning

    Sep 9, 2026Jing Guan, Yachao Yang, Zhaoliang Liu +3Model-Agnostic DefenseLLM Defense Mechanisms

  28. Do Input-Level Defenses Transfer to Observation-Level Attacks on VideoLLMs?

    Sep 8, 2026Bangshuo Zhu, Wei Song, Yuxin Cao +4LLM Defense MechanismsFrame Rate

  29. Does Deeper Reasoning Compromise Alignment? Revealing and Mitigating of Alignment Collapse in Large Reasoning Models

    Sep 8, 2026Yu-Hang Wu, Yu-Jie Xiong, Henghua Zhang +3Large Reasoning ModelsSafety Alignment

  30. CoER: Defending against Adaptive Indirect Prompt Injection via Adversarial Co-Evolution and Refinement

    Sep 7, 2026Boyang Zhang, Qingxin Xiao, Lingwei Dang +1Indirect Prompt InjectionLLM Defense Mechanisms

  31. Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented Agents

    Sep 1, 2026Xiaofang Yang, Ziqi Miao, Dianbo Sui +2Runtime Safety FilteringMalicious Agents

  32. Reachability-Based Capability Confinement for LLM Agents under Indirect Prompt Injection

    Aug 30, 2026Wujie Xiong, Rabimba Karanjai, Yang Lu +2LLM Defense MechanismsLarge Language Model Agents

  33. QuISE: Defense against Typographic Attacks on VLMs via Query-Irrelevant Semantic Editing

    Aug 13, 2026Shubin Lu, Jiaqi Yin, Yihao HuangLLM Defense Mechanisms

  34. SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense

    Aug 11, 2026Siyuan Liang, Yupeng Qiu, Junfeng Fang +3Text-To-Video Generation ModelJailbreak Success Rates

  35. Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs

    Aug 10, 2026Hongli Shen, Shaopeng Fu, Qinbo Zhang +2Safety AlignmentJailbreak Attacks

  36. Mind the Hook: Source-Level Auditing of Privacy Defenses in Retrieval-Augmented Generation

    Aug 10, 2026Yanhang Li, Zhichao Fan, Zexin ZhuangModel AuditingLLM Defense Mechanisms

  37. Robust Reputation-Driven Crowdsourced Federated Learning

    Aug 9, 2026Mouhamed Amine Bouchiha, Gregory BlancFederated LearningLog-Ratio-Based Gaussian Trust Weight

  38. LoRAScan: Detecting Backdoor Prompts in Low-Rank Adapters for Large Language Models via Down-Projection Activation Spikes

    Aug 7, 2026Doniyorkhon Obidov, Honggang Yu, Xiaolong Guo +1LLM Defense Mechanisms

  39. Improving Interoperability among Defence and National Security Ontologies: Analysis and Evaluation Tasks

    Aug 6, 2026Jonathon Dilworth, Pedro Giesteira Cotovio, David Herron +4OntologyInteroperability

  40. Hijacking Robots with a Piece of Paper: A Systematic Study of Physical Prompt Injection in VLM-Controlled Robots

    Aug 6, 2026S. M . Bhagya P. Samarakoon, M. A. Viraj J. Muthugala, W. K. R. Sachinthana +1Vlm-To-Vla Capability TransferIndirect Prompt Injection

  41. When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills

    Aug 4, 2026Yongli Xiang, Zhifang Zhang, Bojun Yang +4Persona ConsistencyPrivacy

  42. SRAP: SVD-Refined Adversarial Perturbations for Imperceptible Face-Swap Defense

    Aug 4, 2026Sungwon Cho, Kwanghyun Ko, Myungjoo KangSingular Value DecompositionLLM Defense Mechanisms

  43. Double Down on Defense: Strengthening Deep Perceptual Hashes against Evasion Attacks without Retraining

    Aug 4, 2026Bangjie Sun, Nayoung Kim, Mun Choon Chan +1Locality-Sensitive HashingWhite-Box Spectral-Subspace-Guided Attack

  44. Invisible Ink Threats: Adversarial Goals Behind Legitimate Tasks in Computer-Use Agents

    Aug 3, 2026Jia-Chen Zhang, Ze-Yu Zhang, Kai-Wei ZhangIndirect Prompt InjectionAdversarial Robustness

  45. S3S^3: Improving Agent Safety through Multi-Stage Defense

    Aug 3, 2026Zibo Xiao, Haoyu Wang, Jun SunAgentic WorkflowsLLM Defense Mechanisms

  46. ReACT-CLIP: Response-Aware Test-Time Defense for Vision--Language Models

    Aug 2, 2026Hashmat Shadab Malik, Toluwani Aremu, Samuele Poppi +2Recent Vision-Language ModelsLLM Defense Mechanisms

  47. Adversarial Attacks in Multi-Agent LLM Pipelines: Unveiling Structural Vulnerabilities in Agentic AI Architectures

    Aug 1, 2026Faisal Haque Bappy, Tahrim Hossain, Tarannum Shaila Zaman +3Attacker Large Language ModelMulti-Agent Large Language Model Systems

  48. ARB: A Matched Authorship-Rewriting Benchmark Dataset for AI-Text Detector Evaluation

    Jul 31, 2026Gaetano Perrone, Simon Pietro RomanoMachine-Generated Text DetectionLarge Language Model Benchmarks

  49. A Cross-Architecture Audit of Direction-Based Inference-Time Defences in Vision-Language Models

    Jul 30, 2026Xiangyu Yin, Tora Bodin, Rohan Menon +1Inference-Time DefenseLarge Language Model Jailbreaks