Adversarial Attacks on LLMs

LLM: Large Language Model

Latest papers 238

All topics
CardsList
  1. Inference-Time Vulnerability Beyond Shallow Safety: Alignment Along Generation Trajectories

    Jun 3, 2026Kyungmin Park, Taesup KimAdversarial Attacks on LLMsLLM Safety Alignment

  2. When Autoregressive Consistency Hurts Safety Alignment

    Jun 2, 2026Bochen Lyu, Yiyang Jia, Xiaohao Cai +1Adversarial Attacks on LLMsLLM Safety Alignment

  3. Testing LLM Arithmetic Reasoning Generalization with Automatic Numeric-Remapping Attacks

    Jun 2, 2026Malia Barker, Bishal Lakha, Edoardo Serra +1Numerical Reasoning in Language ModelsMathematical Reasoning Benchmarks

  4. PsychoPass: Geometric Profiling of Multi-Turn Adversarial LLM Conversations

    Jun 2, 2026Muberra Ozmen, Subhabrata MajumdarAdversarial Attacks on LLMsLLM Safety

  5. MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models

    Jun 1, 2026Yingzi Ma, Zhengyue Zhao, Xiaogeng Liu +3Masked Diffusion ModelsAdversarial Attacks on LLMs

  6. Defenses & Enablers For Skill Injection Attacks on Terminal Based Agents

    Jun 1, 2026Yoshinari Fujinuma, Varun Gangal, Traian Rebedea +4Adversarial Attacks on LLMsLLM Agent Security

  7. Dive into Ambiguity: A*-Inspired Multi-Agents Commonsense Obfuscation Attack on LLM Prompts

    May 31, 2026Boxuan Wang, Zhuoyun Li, Xiaowei Huang +1Adversarial Prompt GenerationAdversarial Attacks

  8. Inference Cost Attacks for Retrieval-Augmented Large Language Models

    May 31, 2026Chengliang Liu, Liangbo Ning, Yujuan Ding +1Retrieval-Augmented GenerationAdversarial Attacks

  9. EvoDefense: Co-Evolving Black-Box Defense with Large Language Models

    May 29, 2026Yu Li, Yuenan Hou, Yingmei Wei +2Evolutionary OptimizationAdversarial Attacks on LLMs

  10. Minimal Prompt Perturbations Lead to Code Vulnerabilities: Prompt Fragility and Hidden-State Signals in Coding LLMs

    May 28, 2026Alexander Sternfeld, Andrei Kucharavy, Ljiljana DolamicPrompt SensitivityAdversarial Attacks on LLMs

  11. SciIntBench: Measuring LLM Compliance with Research Integrity Norms Under Adversarial Framing

    May 28, 2026Almene De Meran Meguimtsop, Maria Leonor Pacheco, Daniel E. AcunaAI for ScienceAdversarial Attacks on LLMs

  12. Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills

    May 28, 2026Chia-Yi Hsu, Chia-Mu Yu, Chun-Ying Huang +1Adversarial Prompt GenerationAI Coding Agents

  13. Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations

    May 27, 2026Matteo Gioele Collu, Riccardo Conte, Alberto Giaretta +4LLM InterpretabilityAdversarial Attacks on LLMs

  14. Out of Sight, Not Out of Mind: Unveiling Latent Attack in Latent-based Multi-Agent Systems

    May 27, 2026Chenxi Wang, Ruiyang Huang, Jiayan Sun +2Multi-Agent LLM SystemsAdversarial Attacks

  15. HARP: Measuring Harm Amplification in Multi-Agent LLM Systems

    May 26, 2026Md Hafizur Rahman, Zafaryab Haider, Tanzim Mahfuz +1Multi-Agent LLM SystemsAdversarial Attacks on LLMs

  16. Cordyceps: Covert Control Attacks on LLMs via Data Poisoning

    May 26, 2026Zedian Shao, Charles Fleming, Teodora BalutaLLM Backdoor AttacksAdversarial Attacks on LLMs

  17. Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks

    May 26, 2026Kevin Kuo, Virginia Smith, Chhavi YadavLLM Fine-TuningAdversarial Attacks on LLMs

  18. LLM-as-a-Reviewer: Benchmarking Their Ability, Divergence, and Prompt Injection Resistance as Paper Reviewers

    May 25, 2026Lingyao Li, Junjie Xiong, Changjia Zhu +5LLM EvaluationLLM-as-a-Judge

  19. Evo-Attacker: Memory-Augmented Reinforcement Learning for Long-Horizon Tool Attacks on LLM-MAS

    May 25, 2026Bingyu Yan, Xiaoming Zhang, Jinyu Hou +4Adversarial Attacks on LLMsLLM Agent Security

  20. Inverting the Shield: Systematically Generating Safety Tests from Policy Specifications

    May 24, 2026Xiaoyue Lu, Xianglin Yang, Haijun Liu +4Automated Software TestingLanguage Model Safety Evaluation

  21. Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges

    May 24, 2026Xianglin Yang, Bryan Hooi, Gelei Deng +2LLM EvaluationLLM-as-a-Judge

  22. Reasoning as an Attack Surface: Adaptive Evolutionary CoT Jailbreaks for LLMs

    May 23, 2026Jianan Li, Simeng Qin, Xiaojun Jia +5Adversarial Attacks on LLMsLLM Jailbreak Attacks