Adversarial Training

Latest papers 115

All topics
CardsList
  1. Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO

    Jun 8, 2026Blake Bullwinkel, Eugenia Kim, Amanda Minnich +1Adversarial TrainingAdversarial Attacks on LLMs

  2. Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks

    Jun 6, 2026Haoming Wen, Shi Chen, Qingyu Shi +4Adversarial TrainingLLM Alignment

  3. CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning

    Jun 4, 2026Rahul Markasserithodi, Aditya Joshi, Yuekang Li +3Adversarial TrainingAdversarial Prompt Generation

  4. Adaptive Causal Alignment for High-Confidence Adversarial Training

    Jun 2, 2026Zhiming Luo, Kejia Zhang, Yingxin Lai +3Adversarial TrainingAdversarial Robustness

  5. Investigating Adversarial Robustness of Multi-modal Large Language Models

    Jun 2, 2026Hashmat Shadab Malik, Muzammal Naseer, Salman KhanAdversarial TrainingVLM Robustness

  6. SORA: Free Second-Order Attacks in Fast Adversarial Training

    May 30, 2026Mazdak Teymourian, Ramtin Moslemi, Farzan Rahmani +1Adversarial TrainingNeural Network Generalization

  7. A Mechanistic Analysis of Adversarial Fine-tuning of Vision Transformers

    May 28, 2026Hannah Gao, Isha Agarwal, Dylan Hadfield-Menell +1Adversarial TrainingFine-Tuning

  8. When Muon Optimizer Meets Adversarial Training: A Theoretical and Empirical Study

    May 26, 2026Jun Yan, Weiquan Huang, Jiankai Zuo +4Adversarial TrainingNeural Network Optimization

  9. Adversarial Training for Robust Coverage Network under Worst-case Facility Losses

    May 26, 2026Changhao Miao, Yuntian Zhang, Tongyu Wu +2Adversarial TrainingCombinatorial Optimization

  10. Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation

    May 23, 2026Luoyu Chen, Weiqi Wang, Zhiyi Tian +5Adversarial TrainingAdversarial Robustness of Language Models

  11. Balancing Fairness, Privacy, and Accuracy: A Multitask Adversarial Framework for Centralized Data-Driven Systems

    May 23, 2026Imesh Ekanayake, Elham Naghizade, Jeffrey ChanAdversarial TrainingRepresentation Learning

  12. Toward Understanding Adversarial Distillation: Why Robust Teachers Fail

    May 21, 2026Hongsin Lee, Hye Won ChungAdversarial TrainingNeural Network Robustness

  13. The Evaluation Game: Beyond Static LLM Benchmarking

    May 19, 2026Paul Wang, Jade Garcia-Bourrée, Anne-Marie Kermarrec +1Adversarial TrainingLLM Auditing

  14. Interaction-Breaking Adversarial Learning Framework for Robust Multi-Agent Reinforcement Learning

    May 18, 2026Sunwoo Lee, Mingu Kang, Yonghyeon Jo +1Adversarial TrainingMulti-Agent Coordination

  15. Compositional Adversarial Training for Robust Visual Watermarking

    May 16, 2026Anirudh Satheesh, Michael-Andrei Panaitescu-Liess, Andrew Xu +4Adversarial TrainingRobust Watermarking

  16. When and Why Adversarial Training Improves PINNs: A Neural Tangent Kernel Perspective

    May 15, 2026Yuan-dong Cao, Chi Chiu SO, Jun-Min Wang +1Adversarial TrainingPDE Surrogate Modeling

  17. WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections

    May 14, 2026Tri Cao, Yulin Chen, Hieu Cao +8Adversarial TrainingPrompt Injection

  18. Taming the Long Tail: Rebalancing Adversarial Training via Adaptive Perturbation

    May 13, 2026Lilin Zhang, Yimo Guo, Yue Li +2Adversarial TrainingClass-Imbalanced Learning

  19. Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation

    May 12, 2026Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed +1Adversarial TrainingAdversarial Prompt Generation

  20. Robust Biomedical Publication Type and Study Design Classification with Knowledge-Guided Perturbations

    May 12, 2026Shufan Ming, Joe D. Menke, Neil R. Smalheiser +1Adversarial TrainingDistribution Shift Robustness

  21. PROWL: Prioritized Regret-Driven Optimization for World Model Learning

    May 11, 2026Ahmet H. Güzel, Jenny Seidenschwarz, Benjamin Graham +3Adversarial TrainingWorld Model Learning

  22. Enhancing Adversarial Robustness in Network Intrusion Detection: A Layer-wise Adaptive Regularization Approach

    May 9, 2026Hira Nasir, Eiman Javed, Balawal Shabir +2Adversarial TrainingNetwork Intrusion Detection

  23. Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms

    May 8, 2026Linh Le, David Williams-King, Mohamed Amine Merzouk +2Adversarial TrainingNeural Network Robustness

  24. Exposing and Mitigating Temporal Attack in Deepfake Video Detection

    May 8, 2026Zheyuan Gu, Minghao Shao, Zhen Wang +4Adversarial TrainingAdversarial Robustness

  25. Dual-Agent Co-Training for Health Coaching via Implicit Adversarial Preference Optimization

    May 7, 2026Da Long, Lingyi Fu, Diya Michelle Rao +3Adversarial TrainingMulti-Agent LLM Systems

  26. Streaming Adversarial Robustness in Fuzzy ARTMAP: Mechanism-Aligned Evaluation, Progressive Training, and Interpretable Diagnostics

    May 7, 2026Shane Cairns, Leonardo Enzo Brito da Silva, Sasha Petrenko +2Adversarial TrainingNeural Network Robustness

  27. Band Together: Untargeted Adversarial Training with Multimodal Coordination against Evasion-based Promotion Attacks

    May 7, 2026Guanmeng Xian, Ning Yang, Philip S. YuAdversarial TrainingMultimodal Robustness

  28. Information Theoretic Adversarial Training of Large Language Models

    May 6, 2026Yiwei Zhang, Jeremiah Birrell, Reza Ebrahimi +3Adversarial TrainingLLM Alignment