LLM Safety Benchmarks

LLM: Large Language Model

Momentum

23 papers in the last four weeks, up 44% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 141

All topics
CardsList
  1. MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

    May 3, 2026Jialin Song, Xiaodong Liu, Weiwei Yang +4LLM Safety BenchmarksAdversarial Prompt Generation

  2. BabelSafe: A Policy-Grounded Multilingual Safety Benchmark for LLMs

    May 1, 2026Yunhan Zhao, Zhaorun Chen, Xingjun Ma +1LLM Safety BenchmarksMultilingual Language Models

  3. ARMOR 2025: A Military-Aligned Benchmark for Evaluating Large Language Model Safety Beyond Civilian Contexts

    Apr 30, 2026Sydney Johns, Heng Jin, Chaoyu Zhang +2LLM Safety BenchmarksLLM Safety Alignment

  4. Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations

    Apr 29, 2026Mingqian Zheng, Malia Morgan, Liwei Jiang +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  5. How Sensitive Are Safety Benchmarks to Judge Configuration Choices?

    Apr 27, 2026Xinran ZhangLLM Safety BenchmarksLLM-as-a-Judge

  6. SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models

    Apr 21, 2026Josue Torres-Fonseca, Naihao Deng, Yinpei Dai +5LLM Safety BenchmarksLarge Language Model-Based Robot Planning

  7. Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety

    Apr 20, 2026Marcello Galisai, Susanna Cifani, Francesco Giarrusso +5LLM Safety BenchmarksAdversarial Attacks on LLMs

  8. MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

    Apr 17, 2026Manh Luong, Tamas Abraham, Junae Kim +6LLM Safety BenchmarksLanguage Model Safety Evaluation

  9. AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents

    Apr 3, 2026Yunhao Feng, Yifan Ding, Yingshui Tan +6LLM Safety BenchmarksComputer-Use Agent Benchmarks

  10. Quantifying Frontier LLM Capabilities for Container Sandbox Escape

    Mar 1, 2026Rahul Marchand, Art O Cathain, Jerome Wynne +5LLM Safety BenchmarksLLM Agent Security

  11. SalamahBench: Dialect and Category Level Safety Evaluation of Arabic Language Models

    Feb 3, 2026Omar Abdelnasser, Fatemah Alharbi, Khaled Khasawneh +2LLM Safety BenchmarksMultilingual Language Model Evaluation

  12. Safety Is Not Universal: The Selective Safety Trap in LLM Alignment

    Jan 7, 2026Iago Alves Brito, Walcy Santos Rezende Rios, Julia Soares Dollis +2LLM Safety BenchmarksLLM Alignment

  13. SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking

    Aug 21, 2025Xiangyang Zhu, Yuan Tian, Chunyi Li +3LLM Safety BenchmarksSynthetic Benchmark Generation

  14. Addressing Benchmarking Gaps in Large Language Models for Health and Medicine with Dynamic Red-Teaming

    Jul 30, 2025Jiazhen Pan, Bailiang Jian, Paul Hager +20LLM Safety BenchmarksLanguage Model Safety Evaluation

  15. CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models

    Jan 24, 2025Guangzhi Sun, Xiao Zhan, Shutong Feng +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  16. Who Judges the Judges? A Chinese Safety QA Benchmark for Evaluating LLM Responses and Safety Judges

    Date pendingRui Yang, Shuang Huang, Junhua Liu +7LLM Safety BenchmarksLLM-as-a-Judge