LLM Safety Benchmarks

LLM: Large Language Model

Momentum

23 papers in the last four weeks, up 44% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 141

All topics
CardsList
  1. Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity

    Aug 1, 2026Yongxi Zhou, Junwei Yao, Yuanzhe Liu +4LLM Safety BenchmarksPrompt Sensitivity

  2. Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis

    Jul 29, 2026Jiachen Qian, Junyu LiAudio-Language Model EvaluationLLM Safety Benchmarks

  3. Poster: Rethinking Security in LLM Code Generation through Real-World Risk Scenarios

    Jul 25, 2026Lixun Ma, Ruolong Ma, Bei Wang +4LLM Safety BenchmarksLLM Security

  4. Beyond Shapley: An Influence-Based Data Auditing Pipeline for LLM Alignment and Evaluation

    Jul 24, 2026Yunting Song, Matthew Watson, Peter Grabowski +1LLM Safety BenchmarksLLM Auditing

  5. SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring

    Jul 21, 2026Chunxiao Li, Yuan Xiong, Lijun Li +4LLM Safety BenchmarksAI Agent Safety Benchmarks

  6. JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models

    Jul 20, 2026Qingjia Huang, Jingyu Zhang, Jianguo Wu +6LLM Safety BenchmarksLLM Jailbreak Attacks

  7. AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation

    Jul 13, 2026Yi Ting Shen, Kentaroh Toyoda, Alex LeungLLM Safety BenchmarksAdversarial Attacks on LLMs

  8. Trivial Prompt Reframing Bypasses Safety Guardrails in Googleś MedGemma-4B

    Jul 9, 2026Avi-ad Avraam BuskilaLLM Safety BenchmarksLanguage Model Safety Evaluation

  9. Seduced by the Narrative: Assessing Rule Adherence in Semi-Open Textual Sandboxes

    Jul 2, 2026Weiying Chen, Junlong Shen, Zhanyuan Guo +1LLM Safety BenchmarksAdversarial Prompt Generation

  10. Out-of-Distribution Generalization of Risk Aversion in Language Models

    Jul 2, 2026Kristina Zhang, Junior Chinomso Okoroafor, Benjamin Maltbie +3LLM Safety BenchmarksOOD Generalization

  11. HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety

    Jul 2, 2026Navaneeth Sangameswaran, Preetham S, Ashmiya LeninLLM Safety BenchmarksLanguage Model Safety Evaluation

  12. OpenSafeIntent: Evaluating Intent-Calibrated Safe Completion Across Dual-Use Prompt Sets

    Jul 2, 2026Rheeya Uppaal, Seungwoo Lyu, Selina Sung +1LLM Safety BenchmarksLanguage Model Safety Evaluation

  13. AIriskEval-edu: New Dataset for Risk Assessment in AI-mediated K-12 Educational Explanations

    Jul 2, 2026Javier Irigoyen, Roberto Daza, Francisco Jurado +5LLM Safety BenchmarksLLM Auditing

  14. The Moving Target: A Longitudinal Audit of Trustworthiness Drift Across Twelve Checkpoints of Open-Source Chat LLMs

    Jul 1, 2026Zhichao Fan, Yanhang Li, Zexin Zhuang +2LLM Safety BenchmarksLLM Evaluation

  15. Security--Fidelity Tradeoffs: The Hidden Cost of Prompt Injection Defense

    Jun 29, 2026Mitchell Hermon, Rahul Gupta, Weitong Ruan +2LLM Safety BenchmarksPrompt Injection Defense

  16. SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing

    Jun 29, 2026Jiacheng Zhang, Haoyu He, Sen Zhang +5LLM Safety BenchmarksLanguage Model Safety Evaluation

  17. CAREBench: A Child-Safety Risk Benchmark for Language Models

    Jun 29, 2026Kaavya Krishna-Kumar, Elaine Lau, Vaughn Robinson +6LLM Safety BenchmarksLanguage Model Safety Evaluation

  18. The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning

    Jun 27, 2026Will Hawkins, Kaivalya Rawal, Jonathan Rystrøm +8LLM Safety BenchmarksMultilingual Language Model Evaluation

  19. FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming

    Jun 18, 2026Chaeyun Kim, Daeyoung Park, Junghwan Kim +4LLM Safety BenchmarksFinancial Services

  20. SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety

    Jun 17, 2026Linghao Feng, Yinqian Sun, Dongqi Liang +8LLM Safety BenchmarksAI for Science