Adversarial Attacks on LLMs

LLM: Large Language Model

Latest papers 238

All topics
CardsList
  1. Market Signal Injection: Adversarial Context Manipulation of LLM Pricing Agents

    Sep 16, 2026Dohun Lee, Hyunwoo ParkAdversarial Attacks on LLMsAI Agent Security

  2. Nameless Tokenization: A Lossless Tokenizer-Level Defense Against Control-Token Forgery in Open-Weight LLMs

    Sep 15, 2026Kisu Yang, Yoonna Jang, Heuiseok LimAdversarial Attacks on LLMsLLM Security

  3. Decoy Direction Optimization: A Post-Hoc Defense Against LLM Abliteration

    Sep 14, 2026Aashiq Muhamed, Mona T. Diab, Virginia SmithAdversarial Attacks on LLMsLLM Safety

  4. Universal Defenses for Tool-Integrated LLM Agents Against Adversarial Attacks

    Sep 14, 2026Xiaoyan Li, Yunli WangAdversarial Attacks on LLMsBackdoor Defense in LLMs

  5. Divide, Consult, Conquer: Capability Laundering Through Aligned LLMs

    Sep 14, 2026Mark Russinovich, Blake Bullwinkel, Giorgio Severi +2Adversarial Attacks on LLMsCybersecurity

  6. Overflip: Repetition-Induced Label Flips in Guardrail Models

    Sep 14, 2026Xu He, Chih-Hsuan Lin, Hung-Mao Chen +3LLM GuardrailsAdversarial Attacks on LLMs

  7. Active Adaptation, Not Static Defense: Temporal Dynamics of Preventative Steering in Adversarial Fine-Tuning

    Sep 9, 2026Jing Guan, Yachao Yang, Zhaoliang Liu +3LLM Fine-TuningAdversarial Attacks on LLMs

  8. CS-Guard: Benchmarking LLM Guardrails for Code Generation Security

    Sep 9, 2026Jinyang Li, Mingyu Guo, Hung X. NguyenLLM GuardrailsAdversarial Attacks on LLMs

  9. Does Deeper Reasoning Compromise Alignment? Revealing and Mitigating of Alignment Collapse in Large Reasoning Models

    Sep 8, 2026Yu-Hang Wu, Yu-Jie Xiong, Henghua Zhang +3Adversarial Attacks on LLMsJailbreak Attacks

  10. Reflex-Guard: A Low-Latency Guardrail for LLM Prompt Safety Using Dense Semantic Embeddings

    Aug 18, 2026Istiaque Ahmed, Afia Anjum Borsha, Ranat Das Prangon +2LLM GuardrailsAdversarial Attacks on LLMs

  11. Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents

    Aug 12, 2026Junliang Liu, Ruoyu Li, Wenxin Tang +4Adversarial Attacks on LLMsLLM Agent Security

  12. Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs

    Aug 12, 2026Nimet Beyza Bozdag, Emre Can Acikgoz, Gokhan Tur +1Deception in Language ModelsAdversarial Attacks on LLMs

  13. Generating Attacks for LLMs with GFlowNets

    Aug 10, 2026Berkay Ozcam, Irem Onen, Mehmet Fatih Amasyali +1Adversarial Prompt GenerationAdversarial Attacks on LLMs

  14. Stealing Reasoning Traces from Proprietary LLM APIs

    Aug 10, 2026Alexander Panfilov, David Schmotz, Ilia Shumailov +5Model Extraction AttacksAdversarial Attacks

  15. Pragmatic Attack Surface: Vulnerabilities of Implicit Context in Large Language Models

    Aug 10, 2026Bocheng Chen, Han Zi, Roucheng Ou +5Pragmatic Reasoning in Language ModelsAdversarial Attacks on LLMs

  16. Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs

    Aug 10, 2026Hongli Shen, Shaopeng Fu, Qinbo Zhang +2Adversarial TrainingAdversarial Attacks on LLMs

  17. When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs

    Aug 9, 2026Yu Ma, Hongli Shi, Jing Li +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  18. Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits

    Aug 7, 2026Elena Dumitrescu, Gert Lek, Lydia Y. Chen +1Adversarial Attacks on LLMsLLM Safety Alignment

  19. Mood Matters: How Syntactic Sensitivity Undermines Safety Alignment

    Aug 5, 2026Alina Klerings, Jannik Brinkmann, Heiner Stuckenschmidt +1Adversarial Attacks on LLMsLLM Safety Alignment

  20. Sharding Prevents LLM Oversight Failures and Adversarial Exploitation

    Aug 5, 2026Victor Akinwande, J. Zico Kolter, Aran NayebiScalable OversightLLM Evaluation

  21. Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks

    Aug 4, 2026Atri Vivek Sharma, Brian Formento, Alessio LomuscioRetrieval-Augmented GenerationAdversarial Attacks