LLM Defense Mechanisms

Momentum

32 papers in the last four weeks, up 256% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 258

All topics
CardsList
  1. Robust Estimation of Sparse Numerical Vectors under Local Differential Privacy

    Jul 30, 2026Puning Zhao, Zhikun Zhang, Shaowei Wang +5Distributionally-Robust OptimizationPoisoning

  2. VETO: Towards Protecting Images From Frontier AI Editing

    Jul 29, 2026Jonas Grebe, Hossein Shakibania, Tobias Braun +2Ai-Generated Image DetectionLLM Defense Mechanisms

  3. InkShield: Writing Style Protection Against Unauthorized Handwriting Mimicry

    Jul 29, 2026Jian Xiong, Wenbo Jiang, Zihan Wang +4HandwritingForgeries

  4. I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models

    Jul 28, 2026Yimao Guo, Zuomin Qu, Wei LuDiffusion TransformersBlack-Box Adversarial Attacks

  5. Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response

    Jul 28, 2026Abu Bakar SiddikCybersecurityModel Vulnerabilities

  6. Hybrid Analysis for Secure MCP Tool Use in LLM Agents

    Jul 28, 2026Ping He, Yuexiang Xie, Yaliang Li +1Large Language Model SafetyLarge Language Model Agents

  7. SafeFlow: Semantic Information-Flow Control for Blocking Malicious Propagation in Multi-Agent Systems

    Jul 28, 2026Haowen Dai, Zonghao Ying, Wenfeng Li +10Information-Flow ControlMalicious Agents

  8. When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs

    Jul 27, 2026Tong Zhang, Zexin Li, Simin Chen +1LLM Defense MechanismsLarge Language Models Fail

  9. Practical Graph Optimisation and AI-Driven Models for Active Directory Security Hardening

    Jul 24, 2026Huy Q. NgoSecurityLLM Defense Mechanisms

  10. A Defense of the Quadratic Model

    Jul 23, 2026Alexandru Meterez, Pranav Ajit Nair, Depen Morwani +3Anisotropic Loss LandscapesLarge Language Model Training

  11. Deep Reinforcement-Learning-Guided Model Predictive Control for Preventing Overtakes in Autonomous Racing

    Jul 23, 2026Yufei Xi, Yijie Liao, Tulga ErsalAutonomous RacingModel Predictive Control

  12. IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests

    Jul 22, 2026Ankur Singh, Jinqiu Yang, Tse-Hsun ChenCoding AgentsVulnerable Code

  13. Defense Against LLM Backdoors using Critical Neuron Isolation Pruning

    Jul 22, 2026Yuxi Li, Zhibo Zhang, Kailong Wang +3Attacker Large Language ModelClean Label Backdoor Attack

  14. CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization

    Jul 21, 2026Xinting Liao, Behnoosh Zamanlooy, Masoumeh Shafieinejad +4Prompt-Injection DetectorsAutomatic Prompt Optimization

  15. The Chronos Vulnerability: A Taxonomy of Temporal Persistence and Memory-Based Deception in Agentic AI

    Jul 20, 2026Om Narayan, Ramkinker Singh, Praveen BaskarRealistic Threat ModelLLM Defense Mechanisms

  16. Self-State Attacks on Self-Hosted AI Agents: How Far Can OS Defenses Go?

    Jul 20, 2026Yimeng Chen, Nathanaël Denis, Roberto Di Pietro +1Diverse AttacksLLM Defense Mechanisms

  17. Reasoning as a Double-Edged Sword: Architecture and Cross-Stage Robustness in Vision-Language-Action Models

    Jul 20, 2026Tuan Duong Trinh, Naveed Akhtar, Basim AzamLLM Defense MechanismsDouble-Edged Sword

  18. Dynamic Defense Profiling Enables Cognitive Jailbreak of Text-to-Image Models

    Jul 20, 2026Dongdong Yang, Deyue Zhang, Zhao Liu +5Adversarial PromptsJailbreak Success Rates

  19. Salience Induction against Multi-Hop RAG Agents: Threat and Defense

    Jul 20, 2026Xingfu Zhou, Pengfei Wang, Yuan Zhou +2LLM Defense MechanismsMulti-Hop Reasoning

  20. How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions

    Jul 19, 2026Yukai Zhou, Feiyang Lu, Xiaokai Mao +2Jailbreak AttacksJailbreaks

  21. A Multi-Model Hybrid Defense Approach Against White-box Adversarial Attacks in Computer Network Traffic

    Jul 19, 2026Khushnaseeb RoshanBlack-Box Adversarial AttacksIntrusion Detection

  22. SpeechGuard: Online Defense against Backdoor Attacks on Speech Recognition Models

    Jul 17, 2026Jinwen Xin, Xixiang LvLLM Defense MechanismsUtterances

  23. Large Audio Language Models for Spoofing-Aware Speaker Verification

    Jul 16, 2026Sofya Savelyeva, Mariia Perunova, Evgeny Kushnir +3Automatic Speaker VerificationLarge Audio Language Models

  24. Securing Autonomous Vehicle Systems via Twin-Aware Federated Reinforcement Learning

    Jul 9, 2026Zifan Zhang, Minghong Fang, Dianwei Chen +5PoisoningDigital Twins

  25. Adversarial Decoys: Misdirecting Attention-Based Defenses in ViT

    Jul 8, 2026Giulia Marchiori Pietrosanti, Giulio Rossolini, Giorgio ButtazzoModel-Agnostic DefenseVision Transformer

  26. ORAN-DEFEND: Subspace Detection and Sanitization of Backdoor DRL xApps in Open RAN

    Jul 7, 2026Md Raihan Uddin, Fatemeh Lotfi, Tolunay Seyfi +1Clean Label Backdoor AttackModel-Agnostic Defense

  27. Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses

    Jul 6, 2026Neeraj Karamchandani, Piyush Nagasubramaniam, Sencun Zhu +1LLM Reasoning StrategiesLLM Defense Mechanisms

  28. Privacy-Preserving and Verifiable Approximate Distributed Coded Computing

    Jul 2, 2026Xavier Martínez-Luaña, Alba Gude-Santos, Manuel Fernández-Veiga +1Privacy-Preserving Machine LearningFederated Learning

  29. SoK: Attack and Defense Landscape of Mobile On-device AI Systems

    Jul 1, 2026Yujin Huang, Xin Zheng, Xingliang Yuan +1DeviceLLM Defense Mechanisms

  30. Embedding Inference Attack

    Jul 1, 2026Cedric Fitiavana Raelijohn, Sébastien Gambs, Jean-Francois RajotteRetrieval-Augmented Generation PipelinesText Embeddings

  31. TabPATE: Differentially Private Tabular In-Context Learning Without Public Data

    Jun 30, 2026Dariush Wahdany, Matthew Jagielski, Jesse C. Cresswell +2Privacy-Preserving Machine LearningMembership Inference Attacks

  32. MAPE: Defending Against Transferable Adversarial Attacks Using Multi-Source Adversarial Perturbations Elimination

    Jun 30, 2026Xinlei Liu, Jichao Xie, Tao Hu +4Adversarial TrainingLLM Defense Mechanisms

  33. Sampling-Based Coordination-Informed Multi-Objective Multi-Robot Reinforcement Learning

    Jun 29, 2026Antonio Marino, Esteban Restrepo, Soon-jo Chung +2Multi-Robot SystemsMulti-Agent Reinforcement Learning

  34. Security--Fidelity Tradeoffs: The Hidden Cost of Prompt Injection Defense

    Jun 29, 2026Mitchell Hermon, Rahul Gupta, Weitong Ruan +2Prompt-Injection DetectorsLarge Language Model Safety

  35. Wireless Backdoor Attack and Defense for Semantic Communications over Multiple Access Channel

    Jun 29, 2026Yalin E. Sagduyu, Tugba Erpek, Aylin Yener +1Semantic CommunicationsWireless Communications

  36. Linguistic Firewall: Geometry as Defense in Multi-Agent Systems Routing

    Jun 29, 2026Dvir Alsheich, Adar Peleg, Ben Hagag +3Semantic FirewallAttacker Large Language Model

  37. On the Vulnerability of Parameter-Level Defenses to Model Merging

    Jun 29, 2026Kuangpu Guo, Qingyan Zheng, Jian Liang +4Model-Agnostic DefenseLLM Defense Mechanisms

  38. Theory of Continual Learning Against Data Poisoning Attacks

    Jun 29, 2026Yiting Hu, Lingjie DuanReplay-Based Continual LearningPoisoning

  39. The Platonic Defense: Backdoor Defense for Self-Supervised Encoders in the Era of Large Scale Pre-training

    Jun 28, 2026Tuo Chen, Minjing Dong, Benlei Cui +2EncodersLLM Defense Mechanisms

  40. FlipGuard: Defending Large Language Models Against Quantization-Conditioned Backdoor Attacks

    Jun 27, 2026Aoying Zheng, Anqi Du, Zizhuang Deng +1Large Language Model BackbonesLLM Defense Mechanisms

  41. Clustering Unsupervised Representations as Defense against Poisoning Attacks on Speech Commands Classification System

    Jun 27, 2026Thomas Thebaud, Sonal Joshi, Henry Li +4PoisoningLLM Defense Mechanisms

  42. Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents

    Jun 25, 2026Praneeth Narisetty, Shiva Nagendra Babu Kore, Uday Kumar Reddy Kattamanchi +1Indirect Prompt InjectionLLM Defense Mechanisms

  43. Security and Privacy in Retrieval-Augmented Generation: Architectures, Threats, Defenses, and Future Directions for Building Trustworthy Systems

    Jun 24, 2026Balamurugan Palanisamy, G S S Chalapathi, Vikas Hassija +1Agentic Retrieval-Augmented Generation SystemsLarge Language Model Safety

  44. What Does It Mean to Break a Distillation Defense?

    Jun 23, 2026Lena Libon, Pura Peetathawatchai, Michael Aerni +2Realistic Threat ModelLLM Defense Mechanisms

  45. Analyzing Defensive Misdirection Against Model-Guided Automated Attacks on Agentic AI Systems

    Jun 18, 2026Reza Soosahabi, Vivek NamsaniLLM Defense MechanismsAttack-Success Rate

  46. Pseudo-Feature Padding: A Lightweight Defense Against False Data Injection in Power Grids

    Jun 18, 2026Farhin Farhad Riya, Shahinul Hoque, Yingyuan Yang +2Cyber-Physical SystemPower Systems

  47. When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents

    Jun 18, 2026Kaiyue Yang, Yuyan Bu, Jingwei Yi +5Controlling Tool UseLarge Language Model Agents

  48. Blame is easier than praise: Measuring off-ball defensive performance in football

    Jun 18, 2026Jonas Bischofberger, Runqing Ma, Pascal Bauer +2LLM Defense MechanismsGround Truth

  49. TRAP: Benchmark for Task-completion and Resistance to Active Privacy-extraction

    Jun 17, 2026Moon Ye-Bin, Nam Hyeon-Woo, Baek Seong-Eun +2PrivacyLeakage

  50. MorphStrata: Layer-Specific Perturbations for Generating Morphence Students in Time-Series Moving Target Defense

    Jun 16, 2026Abhishek Bhardwaj, Arnav Doshi, Anusri Nagarajan +5Adversarial TrainingLLM Defense Mechanisms

  51. Automated jailbreak attack targeting multiple defense strategies

    Jun 15, 2026Qi Wang, Chengcheng Wan, Weijia He +4Attacker Large Language ModelJailbreak Attacks

  52. Beyond Defensive Reporting: Machine Learning for Active Anti-Money Laundering Control in Insurance

    Jun 15, 2026Dara Goldar, Geir Kjetil Ferkingstad Sandve, Martin JullumAnti-Money LaunderingInsurance