Adversarial Attacks on LLMs

LLM: Large Language Model

Latest papers 238

All topics
CardsList
  1. Information Theoretic Adversarial Training of Large Language Models

    May 6, 2026Yiwei Zhang, Jeremiah Birrell, Reza Ebrahimi +3Adversarial TrainingLLM Alignment

  2. Redefining AI Red Teaming in the Agentic Era: From Weeks to Hours

    May 5, 2026Raja Sekhar Rao Dheekonda, Will Pearce, Nick LandersAdversarial Attacks on LLMsLLM Red Teaming

  3. Exposing LLM Safety Gaps Through Mathematical Encoding:New Attacks and Systematic Analysis

    May 5, 2026Haoyu Zhang, Mohammad Zandsalimy, Shanu SushmitaLanguage Model Safety EvaluationAdversarial Attacks on LLMs

  4. Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection

    May 2, 2026Xulin Hu, Che Wang, Wei Yang Bryan Lim +2Adversarial Attacks on LLMsLLM Refusal Behavior

  5. A Theoretical Game of Attacks via Compositional Skills

    May 1, 2026Xinbo Wu, Huan Zhang, Abhishek Umrawal +1Adversarial Prompt GenerationAdversarial Attacks on LLMs

  6. FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios

    May 1, 2026Yutao Hou, Yihan Jiang, Yuhan Xie +5Multilingual Language Model EvaluationLanguage Model Safety Evaluation

  7. RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs

    May 1, 2026Zhiyuan Xu, Joseph Gardiner, Sana Belguith +1Mixture-of-Experts Language ModelsAdversarial Attacks on LLMs

  8. The Power of Order: Fooling LLMs with Adversarial Table Permutations

    May 1, 2026Xinshuai Dong, Haifeng Chen, Xuyuan Liu +5Table QAAdversarial Attacks on LLMs

  9. Attention Is Where You Attack

    Apr 30, 2026Aviral Srivastava, Sourav PandaSelf-AttentionAdversarial Attacks

  10. Adaptive Prompt Embedding Optimization for LLM Jailbreaking

    Apr 27, 2026Miles Q. Li, Benjamin C. M. Fung, Boyang Li +2Adversarial Prompt GenerationAdversarial Attacks on LLMs

  11. When AI reviews science: Can we trust the referee?

    Apr 26, 2026Jialiang Wang, Yuchen Liu, Hang Xu +7LLM AuditingAdversarial Attacks on LLMs

  12. Semantic Denial of Service in LLM-controlled robots

    Apr 25, 2026Jonathan Steinberg, Oren GalLanguage Model Safety EvaluationAdversarial Attacks on LLMs

  13. Training a General Purpose Automated Red Teaming Model

    Apr 24, 2026Aishwarya Padmakumar, Leon Derczynski, Traian Rebedea +1Adversarial Attacks on LLMsLLM Red Teaming

  14. Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models

    Apr 22, 2026Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis +2Adversarial Attacks on LLMsAI Agent Security

  15. AVISE: Framework for Evaluating the Security of AI Systems

    Apr 22, 2026Mikko Lempinen, Joni Kemppainen, Niklas RaesalmiLanguage Model Safety EvaluationAdversarial Attacks on LLMs

  16. Breaking Bad: Interpretability-Based Safety Audits of State-of-the-Art LLMs

    Apr 22, 2026Krishiv Agarwal, Ramneet Kaur, Colin Samplawski +6Language Model Safety EvaluationLLM Auditing

  17. ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward System

    Apr 20, 2026Jiacheng Liang, Yao Ma, Tharindu Kumarage +5Reward ModelingAdversarial Attacks on LLMs

  18. Towards Understanding the Robustness of Sparse Autoencoders

    Apr 20, 2026Ahson Saiyed, Sabrina Sadiekh, Chirag AgarwalAdversarial Attacks on LLMsJailbreak Robustness

  19. Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety

    Apr 20, 2026Marcello Galisai, Susanna Cifani, Francesco Giarrusso +5LLM Safety BenchmarksAdversarial Attacks on LLMs

  20. Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks

    Apr 20, 2026Jin Zhao, Marta Knežević, Tanja KäserLLM EvaluationIntelligent Tutoring Systems

  21. SafeAgent: A Runtime Protection Architecture for Agentic Systems

    Apr 19, 2026Hailin Liu, Eugene Ilyushin, Jie Ni +1Adversarial Attacks on LLMsAI Agent Security

  22. Bit-Flip Vulnerability of Shared KV-Cache Blocks in LLM Serving Systems

    Apr 19, 2026Yuji Yamamoto, Satoshi MatsuuraLLM ServingAdversarial Attacks on LLMs

  23. Jailbreaking Large Language Models with Morality Attacks

    Apr 18, 2026Ying Su, Mingen Zheng, Weili Diao +1Moral Reasoning in Language ModelsLanguage Model Safety Evaluation