Adversarial Robustness of Language Models

Latest papers 123

All topics
CardsList
  1. TSCheater: Generating High-Quality Tibetan Adversarial Texts via Visual Similarity

    Dec 3, 2024Xi Cao, Quzong Gesang, Yuan Sun +2Adversarial Robustness of Language ModelsAdversarial Text Attacks

  2. Learning diverse attacks on large language models for robust red-teaming and safety tuning

    May 28, 2024Seanie Lee, Minsu Kim, Lynn Cherif +8Adversarial Attacks on LLMsLLM Red Teaming

  3. Who Judges the Judges? A Chinese Safety QA Benchmark for Evaluating LLM Responses and Safety Judges

    Date pendingRui Yang, Shuang Huang, Junhua Liu +7LLM Safety BenchmarksLLM-as-a-Judge