LLM Security

LLM: Large Language Model

Latest papers 200

All topics
CardsList
  1. Patcher: Post-Hoc Patching of Backdoored Large Language Models

    Jun 2, 2026Anjun Gao, Yueyang Quan, Yufei Xia +2LLM Backdoor AttacksBackdoor Attacks

  2. Emergent Languages in Populations of Language Model Agents: From Token Efficiency to Oversight Evasion

    May 29, 2026Stine Lyngsø Beltoft, William Brach, Federico Torrielli +5LLM SecurityLLM Safety

  3. Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense

    May 29, 2026Shuhao Zhang, Jiarui Li, Qi Cao +2AI Agent Security BenchmarksLLM Security

  4. CacheProbe: Auditing Prompt Cache Isolation in Gateway APIs

    May 28, 2026Ryan FaheyKV CachingLLM Auditing

  5. Fingerprinting Inference Systems of Large Language Models

    May 28, 2026Anna Wimbauer, Jonas Möller, Erik Imgrund +1LLM InferenceLanguage Model Fingerprinting

  6. Measuring Real-World Prompt Injection Attacks in LLM-based Resume Screening

    May 27, 2026Mohan Zhang, Yuqi Jia, Zhen Tan +4LLM SecurityIndirect Prompt Injection

  7. Blind PRNG Hijacking: An Undetectable Integrity-Preserving Attack Against LLM Watermarking

    May 27, 2026Ziyang You, Huilong He, Xiaoke Yang +1LLM SecurityLLM Watermarking

  8. Position: Retire the "Positive Backdoor" Label -- Secret Alignment Requires Strict and Systematic Evaluation

    May 27, 2026Jianwei Li, Jung-Eun KimLLM Backdoor AttacksLanguage Model Safety Evaluation

  9. Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security

    May 27, 2026Xiang Fang, Wanlong FangLLM SecurityPrompt Injection Defense

  10. Conceptual Steganography

    May 26, 2026Zhejian Zhou, Jonathan MayCoT ReasoningLLM Security

  11. Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions

    May 24, 2026Wenjuan Li, Yitao Liu, Runze Chen +1LLM Backdoor AttacksLLM Fine-Tuning

  12. Enhancing Reliability in LLM-Based Secure Code Generation

    May 22, 2026Mohammed F. Kharma, Mohammad Alkhanafseh, Ahmed Sabbah +1LLM EvaluationCoT Reasoning

  13. An Empirical Evaluation of LLM-Generated Code Security Across Prompting Methods

    May 22, 2026Mohammed Kharma, Ahmed Sabbah, Mohammad Alkhanafseh +2LLM PromptingLLM Security

  14. PoisonForge: Task-Level Targeted Poisoning Benchmark for Instruction-Tuned LLMs

    May 22, 2026Luze Sun, Anshuman Suri, Harsh Chaudhari +2LLM Safety BenchmarksLLM Backdoor Attacks

  15. Security of LLM-generated Code: A Comparative Analysis

    May 21, 2026Srivathsan G Morkonda, Mahmoud Selim, Hala AssalSoftware SecurityLLM Security

  16. Trusted Weights, Treacherous Optimizations? Optimization-Triggered Backdoor Attacks on LLMs

    May 20, 2026Yifei Wang, Yida Yang, Tianlin Li +3LLM Backdoor AttacksBackdoor Attacks

  17. When Efficiency Backfires: Cascading LLMs Trigger Cascade Failure under Adversarial Attack

    May 17, 2026Zehan Sun, Dingfan Chen, Songze LiAdversarial Attacks on LLMsLLM Security

  18. STRIDE-AI: A Threat Modeling Framework for Generative AI Security Assessment

    May 16, 2026Tsafac Nkombong Regine Cyrille, Franziska SchwarzAI AssuranceAI Risk Management

  19. Hidden in Memory: Sleeper Memory Poisoning in LLM Agents

    May 14, 2026Sidharth Pulipaka, Stanislau Hlebik, Leonidas Raghav +4Persistent Memory for Language ModelsLLM Security

  20. MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs

    May 14, 2026Rui Wen, Mark Russinovich, Andrew Paverd +2LLM Backdoor AttacksBackdoor Attacks

  21. Talk is (Not) Cheap: A Taxonomy and Benchmark Coverage Audit for LLM Attacks

    May 14, 2026Karthik Raghu Iyer, Yazdan Jamshidi, Nicholas Bray +1LLM Safety BenchmarksBenchmark Auditing

  22. Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding

    May 13, 2026Shuoyang Sun, Chang Dai, Hao Fang +6Adversarial Attacks on LLMsSpeculative Decoding

  23. LoREnc: Low-Rank Encryption for Securing Foundation Models and LoRA Adapters

    May 13, 2026Beomjin Ahn, Jungmin Kwon, Chanyong Jung +1Low-Rank AdaptationLLM Security

  24. CoT-Guard: Small Models for Strong Monitoring

    May 12, 2026Nirav Diwan, Han Wang, Berkcan Kapusuzoglu +6LLM AuditingAdversarial Attacks on LLMs

  25. Robust LLM Unlearning Against Relearning Attacks: The Minor Components in Representations Matter

    May 12, 2026Zeguan Xiao, Xuanzhe Xu, Yun Chen +4Neural Representation GeometryLLM Security

  26. Natural Language based Specification and Verification

    May 11, 2026Zhaorui Li, Chengyu SongFormal VerificationLLM Security