Language Model Safety Evaluation

Latest papers 396

All topics
CardsList
  1. Addressing Benchmarking Gaps in Large Language Models for Health and Medicine with Dynamic Red-Teaming

    Jul 30, 2025Jiazhen Pan, Bailiang Jian, Paul Hager +20LLM Safety BenchmarksLanguage Model Safety Evaluation

  2. PRISON: Unmasking the Criminal Potential of Large Language Models

    Jun 19, 2025Xinyi Wu, Geng Hong, Pei Chen +3Language Model Safety EvaluationLLM Auditing

  3. When Do Large Language Models Exhibit Unsolicited Deception?

    Mar 31, 2025Samuel M. Taylor, Benjamin K. BergenLanguage Model Safety EvaluationDeception in Language Models

  4. GuidedBench: Measuring and Mitigating the Evaluation Discrepancies of In-the-wild LLM Jailbreak Methods

    Feb 24, 2025Ruixuan Huang, Xunguang Wang, Zongjie Li +2Language Model Safety EvaluationLLM Jailbreak Attacks

  5. CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models

    Jan 24, 2025Guangzhi Sun, Xiao Zhan, Shutong Feng +2LLM Safety BenchmarksLanguage Model Safety Evaluation