Adversarial Robustness of Language Models

Latest papers 123

All topics
CardsList
  1. Defenses & Enablers For Skill Injection Attacks on Terminal Based Agents

    Jun 1, 2026Yoshinari Fujinuma, Varun Gangal, Traian Rebedea +4Adversarial Attacks on LLMsLLM Agent Security

  2. CSULoRA: Closest Safe Update Low-Rank Adaptation

    May 28, 2026Oleksandr Marchenko Breneur, Adelaide Danilov, Aria Nourbakhsh +1Adapter TuningLow-Rank Adaptation

  3. Mitigating Adaptive Attacks against Reasoning Models with Activation Consistency Training

    May 27, 2026Avidan Shah, Jannik Brinkmann, Rico AngellPrompt Injection DefenseAdversarial Robustness of Language Models

  4. SafeMed-R1: Clinician-Audited Safety and Ethics Alignment for Medical Large Language Models

    May 27, 2026Chao Ding, Mouxiao Bian, Tianbin Li +12HealthcareLLM Auditing

  5. Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security

    May 27, 2026Xiang Fang, Wanlong FangLLM SecurityPrompt Injection Defense

  6. Curriculum Learning for Safety Alignment

    May 25, 2026Sandeep Kumar, Virginia Smith, Chhavi YadavLLM AlignmentDirect Preference Optimization

  7. From Automation to Collaboration: Human-in-the-Loop Methods for Safe and Trustworthy NLP

    May 24, 2026Most. Sharmin Sultana Samu, MD. Tanvir Ahmed Seum, Md. Rakibul IslamLLM AuditingHuman-in-the-Loop Annotation

  8. Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection

    May 24, 2026Lixing Lin, Juli You, Yue Li +4Language Model Safety EvaluationLLM Guardrails

  9. Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation

    May 23, 2026Luoyu Chen, Weiqi Wang, Zhiyi Tian +5Adversarial TrainingAdversarial Robustness of Language Models

  10. Harder to Defend: Towards Chinese Toxicity Attacks via Implicit Enhancement and Obfuscation Rewriting

    May 21, 2026Jingyi Kang, Junyu Lu, Bo Xu +4Language Model Safety EvaluationToxicity Detection

  11. Towards Context-Invariant Safety Alignment for Large Language Models

    May 20, 2026Yixu Wang, Yang Yao, Xin Wang +4RL for Language ModelsLLM Alignment

  12. REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak

    May 20, 2026Jiachen Ma, Jiawen Zhang, Xiangtian Li +3LLM Self-RefinementLLM Safety

  13. Adaptive Probe-based Steering for Robust LLM Jailbreaking

    May 19, 2026Junxi Chen, Junhao Dong, Xiaohua XieLanguage Model SteeringAdversarial Attacks on LLMs

  14. The Evaluation Game: Beyond Static LLM Benchmarking

    May 19, 2026Paul Wang, Jade Garcia-Bourrée, Anne-Marie Kermarrec +1Adversarial TrainingLLM Auditing

  15. A Few Steps Further: Why Defenses Against Malicious Finetuning Erode Under Continued Training

    May 14, 2026Itay Zloczower, Eyal Lenga, Gilad Gressel +1Language Model Safety EvaluationAdversarial Attacks on LLMs

  16. Reducing the Safety Tax in LLM Safety Alignment with On-Policy Self-Distillation

    May 14, 2026Yu Fu, Longxuan Yu, Haz Sameen Shahgir +4LLM AlignmentOn-Policy Self-Distillation

  17. Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation

    May 12, 2026Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed +1Adversarial TrainingAdversarial Prompt Generation

  18. Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning

    May 12, 2026Chi Zhang, Haibo Qiu, Qiming Zhang +3RL for Language Model ReasoningAdversarial Attacks on LLMs

  19. Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories

    May 9, 2026Dongcheng Zhang, Yi Zhang, Yuxin Chen +3LLM Self-CorrectionRL for Language Model Reasoning

  20. Internalizing Safety Understanding in Large Reasoning Models via Verification

    May 9, 2026Yi Zhang, Yuxin Chen, Leheng Sheng +4LLM Safety AlignmentLLM Safety

  21. Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms

    May 8, 2026Linh Le, David Williams-King, Mohamed Amine Merzouk +2Adversarial TrainingNeural Network Robustness

  22. The Attacker in the Mirror: Breaking Self-Consistency in Safety via Anchored Bipolicy Self-Play

    May 8, 2026Gabriele La Malfa, Emanuele La Malfa, Saar Cohen +4Self-Play RLLanguage Model Safety Evaluation

  23. Can You Break RLVER? Probing Adversarial Robustness of RL-Trained Empathetic Agents

    May 8, 2026Deeraj S K, Sadhana Devarajan, Krishna Mehra +1Emotion Recognition in ConversationsAdversarial Robustness of Language Models

  24. Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks

    May 7, 2026Guoxin Lu, Letian Sha, Qing Wang +4LLM Fine-TuningLLM Safety Alignment