LLM Security

LLM: Large Language Model

Latest papers 200

All topics
CardsList
  1. LLM-Based Scientific Peer Review: Methods, Benchmarks, and Reliability Challenges

    Jun 23, 2026Thi Huyen Nguyen, Zahra AhmadiScholarly Peer ReviewLLM Security

  2. FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation

    Jun 22, 2026Yinpeng Wu, Yitong Chen, Lixiang Wang +3LLM ServingOn-Device Language Model Inference

  3. GIF: Locally Sound Geometric Information Flow Control for LLMs

    Jun 22, 2026Adam Storek, Nikolaus Holzer, Zhuo Zhang +1Privacy Leakage in Language ModelsLLM Security

  4. Toward Open Weight Models Without Risks: Separating Public and Private Capabilities in LLMs

    Jun 19, 2026Charbel El Feghali, Arkil Patel, Nicholas Meade +3Open-Weight Language ModelsLLM Security

  5. Analyzing the Narration Gap in LLM-Solver Loops

    Jun 17, 2026Zunchen Huang, Songgaojun DengAdversarial Attacks on LLMsFormal Verification

  6. FloatDoor: Platform-Triggered Backdoors in LLMs

    Jun 17, 2026Nils Loose, Jonas Sander, Felix Mächtle +1LLM Backdoor AttacksBackdoor Attacks

  7. How Much Can We Trust LLM Search Agents? Measuring Endorsement Vulnerability to Web Content Manipulation

    Jun 15, 2026Yimeng Chen, Zhe Ren, Firas Laakom +3LLM Agent EvaluationAI Agent Security

  8. The Proxy Knows Too Much: Sealing LLM API Routers with Attested TEEs

    Jun 15, 2026Sipeng Xie, Qianhong Wu, Hengrun Lu +4Remote AttestationLLM Agent Security

  9. Loss Landscape Poisoning: Targeted Extraction of Unseen Training Data from LLMs

    Jun 15, 2026Md Abdullah Al Mamun, Ngoc Phu Doan, Pedram Zaree +2Privacy Leakage in Language ModelsLLM Security

  10. SPARK: Security Knowledge Priming and Representation-Guided Knowledge Activation for LLM-based Secure Code Generation

    Jun 15, 2026Xiaoyun Xu, Lichao Wu, Jona te Lintelo +2Knowledge Augmentation for Language ModelsLLM Security

  11. TriAdReview: Triangular Adversarial Review Architecture for Multi-Model Technical Document Generation

    Jun 13, 2026Zhiqiang Zhou, Junliang Dai, Xu LingMulti-Agent LLM SystemsLLM Evaluation

  12. Dummy Backdoor as a Defense: Removing Unknown Backdoors via Shared Internal Mechanisms for Generative LLMs

    Jun 10, 2026Kazuki Iwahana, Masaru Matsubayashi, Takuma Koyama +3LLM Backdoor AttacksBackdoor Defense in LLMs

  13. PermDoRA -- Understanding Adapter Interference in Language Models: Limits of Parameter-Space Geometry

    Jun 9, 2026Gowtham Sivaramakrishnan, Sarvesha Kumar Kombaiah Seetha, Kishan Gupta Balaji +1Low-Rank AdaptationLLM Security

  14. MIRAGE: A Polarity-Flipping Encoding Subspace in LLM Agents

    Jun 9, 2026Pratibha Revankar, Kargi Chauhan, Jihye Kim +3LLM InterpretabilityAI Agent Security

  15. Now You (Still) See Me: Detecting Evasive Steganographic Payloads in LLMs

    Jun 8, 2026Charles Westphal, Timothy Douglas, Keivan Navaie +2LLM Backdoor AttacksAdversarial Attacks on LLMs

  16. Steganography Without Modification: Hidden Communication via LLM Seeds

    Jun 8, 2026Felix Mächtle, Jonas Sander, Sebastian Berndt +3Language Model DecodingLLM Inference

  17. When Behavioral Safety Evaluation Fails: A Representation-Level Perspective

    Jun 6, 2026Enyi Jiang, Anders Gjølbye, Yibo Jacky Zhang +1Language Model Safety EvaluationLLM Auditing

  18. RecurGuard: Runtime Monitoring for Reasoning-Token Consumption Attacks

    Jun 6, 2026Abid Aziz, Hafsa Binte KibriaAdversarial Attacks on LLMsLLM Security

  19. Shared Latent Structures Enable Unified Backdoor Detection and Mitigation in LLMs

    Jun 6, 2026Omar Mahmoud, Aly M. Kassem, Thommen George Karimpanal +4LLM Backdoor AttacksBackdoor Defense in LLMs

  20. An Embarrassingly Simple Detector for Model Extraction Attacks in Large Language Model API Traffic

    Jun 4, 2026Shuze Liu, Qianwen Guo, Yushun DongModel Extraction AttacksLLM Security

  21. Sequential Data Poisoning in LLM Post-Training

    Jun 3, 2026Jack Sanderson, Yihan Wang, Xiaoqian Lu +2LLM SecurityLLM Post-Training

  22. Hybrid Adversarial Defence for Natural Language Understanding Tasks

    Jun 3, 2026Manar Abouzaid, Yang Wang, Chenghua Lin +1LLM Hallucination MitigationLLM Security

  23. Backdoor Unlearning Generalization: A Path Toward the Removal of Unknown Triggers in LLMs

    Jun 2, 2026Lisa Bouger, Théo Lasnier, Philippe Loubet Moundi +2LLM Backdoor AttacksBackdoor Defense in LLMs

  24. RogueMerge: Robust and Unified Attacks against LLM Model Merging

    Jun 2, 2026Jinghuai Zhang, Yetian He, Kunlin Cai +3LLM SecurityTask Vector Merging

  25. Can Factual Opinions Be Edited (Manipulated) in Large Language Models?

    Jun 2, 2026Yuanpu Cao, Ziyi Yin, Fenglong Ma +1Knowledge EditingLLM Security