LLM Safety Benchmarks

LLM: Large Language Model

Momentum

23 papers in the last four weeks, up 44% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 141

All topics
CardsList
  1. SafeClawBench: Separating Semantic, Audit-Evidence, and Sandbox Harm in Tool-Using LLM Agents

    Jun 16, 2026Yuchuan Tian, Mengyu Zheng, Haocheng Mei +5LLM Safety BenchmarksLLM Agent Security

  2. MIRAGE: Auditing Anti-Muslim Bias in Frontier LLMs Across Reasoning, Agentic, and Time-Coupled Conditions

    Jun 15, 2026Noor Islam S. Mohammad, Tamim SheikhLLM Safety BenchmarksLLM Auditing

  3. CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment

    Jun 13, 2026Wenbo Yu, Bohua Wang, Hao Fang +10LLM Safety BenchmarksLanguage Model Safety Evaluation

  4. BELLS-O: Evaluating the Operational Trade-offs of LLM Supervision Systems

    Jun 12, 2026Leonhard Waibl, Felix Michalak, Hadrien MariacciaLLM Safety BenchmarksLLM Guardrails

  5. Schützen: Evaluating LLM Safety in Bulgarian and German Contexts

    Jun 9, 2026Kiril Georgiev, Yuxia Wang, Dimitar Iliyanov Dimitrov +2LLM Safety BenchmarksMultilingual Language Model Evaluation

  6. AICompanionBench: Benchmarking LLMs-as-Judges for AI Companion Safety

    Jun 3, 2026Yanjing Ren, Reza Ebrahimi, TengTeng MaLLM Safety BenchmarksLLM-as-a-Judge

  7. PreAct-Bench: Benchmarking Predictive Monitoring in LLMs

    Jun 3, 2026Hainiu Xu, Italo Luis da Silva, Jiangnan Ye +7LLM Safety BenchmarksMoral Reasoning in Language Models

  8. TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages

    May 31, 2026Victor Akinode, Senyu Li, Wassim Hamidouche +3LLM Safety BenchmarksMultilingual Language Model Evaluation

  9. Triaging Threats to Specialized Guardrails

    May 29, 2026Wenjie Jacky Mo, Xiaofei Wen, Rui Cai +6LLM Safety BenchmarksLLM Guardrails

  10. Efficient Safety Benchmarking via Item Response Theory

    May 26, 2026Fabio Spagliardi, Mírian Silva, Ayan Datta +3LLM Safety BenchmarksLanguage Model Safety Evaluation

  11. When Medical Safety Alignment Fails: A Benchmark for Evaluating LLMs on High-Risk Medical Queries

    May 26, 2026Yige Li, Jun Sun, Wei Zhao +5LLM Safety BenchmarksHealthcare

  12. AlbanianLLMSafety: A Safety Evaluation Dataset for Large Language Models in Albanian

    May 26, 2026Wajdi Zaghouani, Kholoud K. Aldous, Isra FejzullajLLM Safety BenchmarksLanguage Model Safety Evaluation

  13. KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models

    May 26, 2026Wajdi Zaghouani, Shimaa Amer Ibrahim, Aruzhan Muratbek +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  14. Preferred, Not Safer: Pairwise Preference Is a Poor Proxy for Clinical Safety

    May 25, 2026Fay Elhassan, David Sasu, Alexandra Kulinkina +2LLM Safety BenchmarksHuman Preference Evaluation

  15. PoisonForge: Task-Level Targeted Poisoning Benchmark for Instruction-Tuned LLMs

    May 22, 2026Luze Sun, Anshuman Suri, Harsh Chaudhari +2LLM Safety BenchmarksLLM Backdoor Attacks

  16. Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety

    May 21, 2026Piercosma Bisconti, Matteo Prandi, Federico Pierucci +11LLM Safety BenchmarksComputer-Use Agent Benchmarks

  17. RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts

    May 20, 2026Lukas Weidener, Marko Brkić, Mihailo Jovanović +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  18. Talk is (Not) Cheap: A Taxonomy and Benchmark Coverage Audit for LLM Attacks

    May 14, 2026Karthik Raghu Iyer, Yazdan Jamshidi, Nicholas Bray +1LLM Safety BenchmarksBenchmark Auditing

  19. The Great Pretender: A Stochasticity Problem in LLM Jailbreak

    May 14, 2026Jean-Philippe Monteuuis, Cong Chen, Jonathan PetitLLM Safety BenchmarksLLM Evaluation

  20. FragBench: Cross-Session Attacks Hidden in Benign-Looking Fragments

    May 10, 2026Astha Mehta, Niruthiha Selvanayagam, Cedric Lam +10LLM Safety BenchmarksLanguage Model Safety Evaluation

  21. When No Benchmark Exists: Validating Comparative LLM Safety Scoring Without Ground-Truth Labels

    May 7, 2026Sushant Gautam, Finn Schwall, Annika Willoch Olstad +6LLM Safety BenchmarksLLM Evaluation

  22. The Refusal--Compliance Tradeoff: A Large-Scale Safety Behavior Audit of Large Language Models

    May 6, 2026Alif Al Hasan, Sumon BiswasLLM Safety BenchmarksLanguage Model Safety Evaluation

  23. Safety and accuracy follow different scaling laws in clinical large language models

    May 5, 2026Sebastian Wind, Tri-Thien Nguyen, Jeta Sopa +9LLM Safety BenchmarksRetrieval-Augmented Generation