Adversarial Attacks on LLMs

LLM: Large Language Model

Latest papers 238

All topics
CardsList
  1. An Inline Control Architecture for Language Models in Intelligent Transportation Systems

    Aug 4, 2026Narendra Kumar Dewangan, Mounira MsahliLLM GuardrailsAdversarial Attacks on LLMs

  2. ICO: Enhancing Semantic-Shift Jailbreaks via Iterative Context Optimization

    Aug 4, 2026Hujian Zhu, Yihao Huang, Felix Juefei-Xu +5Adversarial Attacks on LLMsJailbreak Attacks

  3. Adversarial Stress Testing of Role-Playing Language Agents using Multi-Agent Evaluation

    Aug 4, 2026Saqib Shouqi, Abdullah Nazly, Januki Wanniarachchi +1Adversarial Attacks on LLMsLLM Agent Evaluation

  4. No Single Neuron of Failure: Distributed Safety Alignment Against White-Box Attacks

    Aug 2, 2026Simiao Xie, Chuancheng Shi, Shangze Li +5LLM AlignmentAdversarial Attacks on LLMs

  5. Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks

    Aug 2, 2026Shangze Li, Chuancheng Shi, Simiao Xie +6Adversarial Attacks on LLMsLLM Safety Alignment

  6. Adversarial Attacks in Multi-Agent LLM Pipelines: Unveiling Structural Vulnerabilities in Agentic AI Architectures

    Aug 1, 2026Faisal Haque Bappy, Tahrim Hossain, Tarannum Shaila Zaman +3Adversarial Attacks on LLMsAI Agent Security

  7. Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs

    Jul 30, 2026Pingyu Wu, Lingyao Zhu, Weiming Zhang +1Adversarial Attacks on LLMsSafety Filtering

  8. RoguePrompt: Dual-Layer Encoding for Self-Reconstruction to Circumvent LLM Moderation

    Jul 29, 2026Benyamin Tafreshian, Prathamesh DhakeAdversarial AttacksAdversarial Attacks on LLMs

  9. Decision-Level Hijacking: Injecting Cognitive Bias into Large Language Models via Bit-Flip Attacks

    Jul 28, 2026Yu Yan, Jiahao Chen, Siqi Lu +6LLM AlignmentAdversarial Attacks on LLMs

  10. Ranked by Position: Order Sensitivity as an Exploitable Attack Surface in LLM Listwise Recommenders

    Jul 26, 2026Ge Zhang, Jingru Cheng, Huiyuan ChenLearning to RankAdversarial Attacks

  11. Implicit Reasoning Steering via Concept Chaining

    Jul 15, 2026Xiao Ye, Sanika Chavan, Yuxi Huang +4Adversarial Attacks on LLMsReasoning Consistency in Language Models

  12. Adversarial Prompting Framework for AI Safety Assessment

    Jul 15, 2026Yash Bhatnagar, Kunal Banerjee, Anirban ChatterjeeAdversarial Prompt GenerationAdversarial Attacks on LLMs

  13. AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation

    Jul 13, 2026Yi Ting Shen, Kentaroh Toyoda, Alex LeungLLM Safety BenchmarksAdversarial Attacks on LLMs

  14. Large Language Models in Misinformation Ecosystems: Misuse, Defense, and Vulnerability

    Jul 11, 2026Lingwei Wei, Dou Hu, Wei Zhou +2Fake News DetectionAdversarial Attacks on LLMs

  15. Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring

    Jul 9, 2026Jennifer Za, Julija Bainiaksina, Nikita Ostrovsky +2Language Model Safety EvaluationAdversarial Attacks on LLMs

  16. Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs

    Jul 8, 2026Anupam Wagle, Ifrat Ikhtear Uddin, Chaowei Zhang +1LLM InterpretabilityAdversarial Attacks on LLMs

  17. Safety Targeted Embedding Exploit via Refinement

    Jul 2, 2026Joshua Adrian CahyonoMultilingual Language Model EvaluationAdversarial Attacks on LLMs

  18. HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment

    Jul 1, 2026Shei Pern Chua, Hao Wu, Qianli Ma +1Adversarial Attacks on LLMsLLM Safety Alignment

  19. Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical Fallacies

    Jun 30, 2026Xudong Shen, Li Yuan, Ye Chen +3LLM EvaluationAdversarial Attacks on LLMs

  20. Words Speak Louder Than Code: Investigating Cognitive Heuristics in LLM-Based Code Vulnerability Detection

    Jun 29, 2026Asif Shahriar, Hongyu Cai, Hadjer Benkraouda +2Software Vulnerability DetectionAdversarial Attacks on LLMs

  21. Linguistic Firewall: Geometry as Defense in Multi-Agent Systems Routing

    Jun 29, 2026Dvir Alsheich, Adar Peleg, Ben Hagag +3Adversarial Attacks on LLMsAgent Evaluation

  22. Jailbreaking for the Average Jane: Choosing Optimal Jailbreaks via Bandit Algorithms for Automatically Enhanced Queries

    Jun 25, 2026Prarabdh Shukla, Ritik, Suhas Rao +2Adversarial Attacks on LLMsLLM Jailbreak Attacks

  23. Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models

    Jun 25, 2026Abrar Alotaibi, Moataz AhmedAdversarial Attacks on VLMsAdversarial Attacks

  24. A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

    Jun 24, 2026Abrar Alotaibi, Raed Mughus, Moataz AhmedMultilingual Language Model EvaluationLLM Evaluation