LLM Security

LLM: Large Language Model

Latest papers 200

All topics
CardsList
  1. LTBD: Learnable Trust-Boundary Delimiters for Prompt Injection Defense

    Oct 8, 2026Luman Zhao, Minghui Xu, Yue Zhang +1LLM SecurityPrompt Injection Defense

  2. SLDR: Defending Against Malicious Fine-tuning via Selective Layers Recovery and Dynamic Routing

    Oct 7, 2026Hui Zhang, Yachao Yuan, Jiayun Wang +3LLM SecurityLLM Safety

  3. Secure Speculative Decoding for Large Language Models

    Oct 6, 2026Yichi Zhang, Zhiqi Wang, Neil Gong +1Adversarial Attacks on LLMsSpeculative Decoding

  4. The Model Plants the Trigger: Answer-Side Backdoor Attacks in Multi-Turn Large Language Models

    Oct 6, 2026Yibo Zhang, Tianrong Guan, Liang Lin +3LLM Backdoor AttacksBackdoor Attacks

  5. Does On-Policy Distillation for Safety Pose Backdoor Risks?

    Oct 6, 2026Jian Luo, Kehan Qi, Qingqiao Hu +5LLM Backdoor AttacksLLM Security

  6. Safeguarding LLMs via Model-Agnostic Latent Safety Signals from Dark Knowledge

    Oct 5, 2026Wonjun Lee, Kyungsik Yang, Gaeun Ji +5Adversarial Attacks on LLMsLLM Security

  7. Backdooring Sparse Autoencoders

    Oct 5, 2026Enrico Ahlers, Daniel Passon, Tobias Kiecker +2LLM Backdoor AttacksAdversarial Attacks

  8. Hidden in the Comments: A Context-Injection Attack Surface in Code LLMs

    Oct 4, 2026Noor Munir, Francesco Quinzan, Stephen RobertsLLM SecurityIndirect Prompt Injection

  9. Hidden Risks of Jev: An Empirical Study of Security, Privacy, and Dual Use

    Oct 4, 2026Shang Wang, Tianqing Zhu, Huajie Chen +3LLM Backdoor AttacksModel Extraction Attacks

  10. The Innocent Courier: Covert Exfiltration Through Legitimate LLM Web Fetching

    Oct 1, 2026Alessandro Pegoraro, Daryan Merx, Phillip Rieger +1LLM Agent SecurityPrivacy Leakage in Language Models

  11. Preemptive LLM Unlearning against Forbidden Capability Acquisition via Gradient Sealing

    Sep 30, 2026Kemou Li, Qizhou Wang, Yue Wang +6LLM SecurityLLM Safety

  12. When a Kindergartener Solves Calculus: Measuring Capability Leakage in Role-Prompted Reasoning Models

    Sep 30, 2026Pakhapoom Sarapat, Saksorn Ruangtanusak, Kunat Pipatanakul +1Large Language Model-Based Role-Play SimulationLLM Security

  13. Learning Steganography Is Easy, Learning Steganographic Reasoning Is Hard

    Sep 30, 2026Julian Schulz, Lukas Fülle, Rieke FruengelLLM SecurityImplicit Reasoning in Language Models

  14. SparLeak: Privacy Leakage from Sparse Attention in LLM Inference on Shared GPUs

    Sep 30, 2026Fahao Chen, Linkang Du, Jinhao Zhou +2LLM InferencePrivacy Leakage in Language Models

  15. Security-Enhanced Seed-Based Weight Quantization for Large Language Models

    Sep 29, 2026Qiuyu Ren, Sudipta Paria, Aritra Dasgupta +1LLM QuantizationLLM Compression

  16. Distillation Defenses Easily Break After Reinforcement Learning

    Sep 28, 2026Shidan Javaheri, Alexander Panfilov, Oliver Britton +2LLM SecurityLanguage Model Distillation

  17. Similarity Is Not Validity: Defending LLM Semantic Caches Against Poisoning

    Sep 28, 2026Zihan Zhang, Shuangjie Yao, Zesen Liu +8LLM SecurityData Poisoning Attacks

  18. On the security and privacy of LLMs in Mobility

    Sep 22, 2026Mauro Conti, Lorenzo Perinello, Umberto SalviatiIntelligent Transportation SystemsLLM Security

  19. SSP-Bench: A Hybrid Data Generation Framework for Safety, Security, and Privacy Evaluation

    Sep 21, 2026Fatih Deniz, Yazan Boshmaf, Issa KhalilLLM Safety BenchmarksLLM Evaluation

  20. ALIBI: Adversarial Legitimacy Injection in Binary Input against LLM Malware Analyzers

    Sep 17, 2026Hyeongjun Choi, Wonyoung Jung, Haehoon Seo +1Adversarial Attacks on LLMsLLM Security

  21. Nameless Tokenization: A Lossless Tokenizer-Level Defense Against Control-Token Forgery in Open-Weight LLMs

    Sep 15, 2026Kisu Yang, Yoonna Jang, Heuiseok LimAdversarial Attacks on LLMsLLM Security

  22. Corrupt Plans, Clean Traces: Evading Chain-of-Thought Monitoring with Plan Injection

    Sep 14, 2026Keertana Chidambaram, Andrew Ilyas, Vasilis SyrgkanisLLM SecurityPrompt Injection Attacks on AI Agents

  23. Overflip: Repetition-Induced Label Flips in Guardrail Models

    Sep 14, 2026Xu He, Chih-Hsuan Lin, Hung-Mao Chen +3LLM GuardrailsAdversarial Attacks on LLMs

  24. What is the Difference Between Me and You? Benchmarking the Quality Gap Between Human-Written and AI-Generated Code

    Sep 14, 2026Cristina Improta, Pietro Liguori, Domenico CotroneoLLM SecurityCode Generation Evaluation