Adversarial Robustness of Language Models

Latest papers 123

All topics
CardsList
  1. SoK: Robustness in Large Language Models against Jailbreak Attacks

    May 6, 2026Feiyue Xu, Hongsheng Hu, Chaoxiang He +9Language Model Safety EvaluationLLM Security

  2. Are LLMs Ready for Conflict Monitoring? Empirical Evidence from West Africa

    May 5, 2026Hoffmann Muki, Olukunle OwolabiText ClassificationAdversarial Robustness of Language Models

  3. Exposing LLM Safety Gaps Through Mathematical Encoding:New Attacks and Systematic Analysis

    May 5, 2026Haoyu Zhang, Mohammad Zandsalimy, Shanu SushmitaLanguage Model Safety EvaluationAdversarial Attacks on LLMs

  4. RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs

    May 3, 2026Sadia Asif, Mohammad Mohammadi AmiriFine-TuningLLM Fine-Tuning

  5. The Power of Order: Fooling LLMs with Adversarial Table Permutations

    May 1, 2026Xinshuai Dong, Haifeng Chen, Xuyuan Liu +5Table QAAdversarial Attacks on LLMs

  6. Dynamic Adversarial Fine-Tuning Reorganizes Refusal Geometry

    Apr 29, 2026Wenhao Lan, Shan Li, Xinhua Lai +4Adversarial TrainingLanguage Model Safety Evaluation

  7. SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts

    Apr 29, 2026Yuan Xin, Yixuan Weng, Minjun Zhu +5Adversarial TrainingAdversarial Prompt Generation

  8. Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skills

    Apr 28, 2026Lijia Lv, Xuehai Tang, Jie Wen +2AI Agent AuditingAI Agent Security

  9. SafeRedirect: Defeating Internal Safety Collapse via Task-Completion Redirection in Frontier LLMs

    Apr 22, 2026Chao Pan, Yu Wu, Xin YaoLLM GuardrailsLLM Safety Alignment

  10. Towards Understanding the Robustness of Sparse Autoencoders

    Apr 20, 2026Ahson Saiyed, Sabrina Sadiekh, Chirag AgarwalAdversarial Attacks on LLMsJailbreak Robustness

  11. Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks

    Apr 20, 2026Jin Zhao, Marta Knežević, Tanja KäserLLM EvaluationIntelligent Tutoring Systems

  12. Do LLMs Hold Their Values? MANTA: A Multi-Turn Adversarial Benchmark for Animal Welfare Reasoning

    Apr 18, 2026Isabella Luong, Joyee Chen, Arturs Kanepajs +5LLM EvaluationMoral Reasoning in Language Models

  13. Stochasticity in Tokenisation Improves Robustness

    Apr 17, 2026Sophie Steger, Rui Li, Sofiane Ennadir +4Adversarial Attacks on LLMsNeural Network Robustness

  14. On the Robustness of LLM-Based Dense Retrievers: A Systematic Analysis of Generalizability and Stability

    Apr 17, 2026Yongkang Li, Panagiotis Eustratiadis, Yixing Fan +1LLM EvaluationRetrieval Robustness

  15. Segment-Level Coherence for Robust Harmful Intent Probing in LLMs

    Apr 16, 2026Xuanli He, Bilgehan Sel, Faizan Ali +3LLM SafetyLLM Jailbreak Attacks

  16. Routing-Aware Safety Alignment for Mixture-of-Experts Models

    Feb 4, 2026Jiacheng Liang, Yuhui Wang, Tanqiu Jiang +1Mixture-of-Experts Language ModelsLLM Alignment

  17. SycoEval-EM: Sycophancy Evaluation of Large Language Models in Simulated Clinical Encounters for Emergency Care

    Jan 23, 2026Dongshen Peng, Yi Wang, Austin Schoeffler +5LLM SycophancyLanguage Model Safety Evaluation

  18. AdversaRiskQA: An Adversarial Factuality Benchmark for High-Risk Domains

    Jan 21, 2026Adam Szelestey, Sofie van Engelen, Tianhao Huang +3Factual Consistency EvaluationLLM Reliability

  19. OI-Bench: An Option Injection Benchmark for Evaluating LLM Susceptibility to Directive Interference

    Jan 19, 2026Yow-Fu Liou, Yu-Chien Tang, Yu-Hsiang Liu +1LLM EvaluationAdversarial Robustness of Language Models

  20. Safety boundary maintenance in consumer AI systems responding to pediatric health queries: a cross-platform benchmark evaluation under naturalistic and adversarially pressured conditions

    Dec 26, 2025Vahideh Zolfaghari, Leila Mashhadi, Mitra Ahadi +2HealthcareLLM Safety

  21. Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models

    Dec 21, 2025Zhang Wei, Hanxuan Chen, Peilu Hu +19Adversarial Robustness of Language ModelsLLM Safety Evaluation

  22. destroR: A Benchmark and Adversarial-Training Defense for Bangla Transfer Models under Meaning-Preserving Attacks

    Nov 13, 2025Saadat Rafid Ahmed, Rubayet Shareen, Radoan Sharkar +3Adversarial TrainingSentiment Analysis

  23. Addressing Benchmarking Gaps in Large Language Models for Health and Medicine with Dynamic Red-Teaming

    Jul 30, 2025Jiazhen Pan, Bailiang Jian, Paul Hager +20LLM Safety BenchmarksLanguage Model Safety Evaluation

  24. Meta-SecAlign: Training LLMs against Prompt Injection for Robust Agents

    Jul 3, 2025Sizhe Chen, Arman Zharmagambetov, David Wagner +1LLM Agent SecurityAI Agent Security Benchmarks

  25. Evaluating the Scalability and Adversarial Generalization of GRPO-Trained NLI Models

    Apr 25, 2025Pablo Miralles-González, Javier Huertas-Tato, Alejandro Martín +1LLM Fine-TuningRL for Language Model Reasoning

  26. Unified Enhancement of the Generalization and Robustness of Language Models via Bi-Stage Optimization

    Mar 19, 2025Yudao Sun, Juan Yin, Juan Zhao +3Adversarial TrainingNeural Network Generalization