LLM Safety Benchmarks

LLM: Large Language Model

Momentum

23 papers in the last four weeks, up 44% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 141

All topics
CardsList
  1. How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense

    Oct 7, 2026Zhankai Ye, Yanning Wang, Yukai Jin +5Refusal Behavior in Language ModelsLLM Safety Alignment

  2. The Pushback Paradox: A Two-Probe Diagnostic for Language Model Compliance

    Oct 5, 2026Stefan Bühler, David Exler, Markus Reischl +1LLM Safety BenchmarksLanguage Model Safety Evaluation

  3. OpenMTB-Audit: Exposing Over-Refusal and Clinical Expert Perspectives in LLM-Based Molecular Tumor Board Safety Evaluation

    Oct 1, 2026Negin Ashrafi, Jia Luo, Stacey M. Frumm +1LLM Safety BenchmarksLLM Auditing

  4. RGDT-Bench: Benchmarking LLM Reasoning for Rule-Governed Decisions and Their Justifications

    Sep 28, 2026Jianpeng Zhao, Haihua Xu, Haoyang Zhang +7LLM Safety BenchmarksLLM Decision-Making

  5. Safety Reconstructed: Generative Modeling via Masked Diffusion Builds Strong Safety Guardrails

    Sep 27, 2026Gert Lek, Abele Malan, Chaoyi Zhu +3LLM Safety BenchmarksLLM Guardrails

  6. Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures

    Sep 24, 2026Ruoqi Guo, Yi Liu, Gelei Deng +6LLM Safety BenchmarksLLM Alignment

  7. ArGuard Shared Task: Harmful Content Detection in Arabic Memes and LLM Prompts

    Sep 24, 2026Firoj Alam, Md. Rafiul Biswas, Mohamed Bayan Kmainasi +5LLM Safety BenchmarksArabic NLP

  8. IndicBankBench: Evaluating Safety and Reliability of Language Model Assistants in Indian Retail Banking

    Sep 24, 2026Suvradip Paul, Chandra Bhushan, Harsh Sharma +4LLM Safety BenchmarksFinancial Services

  9. EADC: Evaluation of Advanced and Deep-level Compliance in Large Language Models

    Sep 22, 2026Yan Zhang, Ruien Li, Yaoyao Peng +4LLM Safety BenchmarksLLM Evaluation

  10. SSP-Bench: A Hybrid Data Generation Framework for Safety, Security, and Privacy Evaluation

    Sep 21, 2026Fatih Deniz, Yazan Boshmaf, Issa KhalilLLM Safety BenchmarksLLM Evaluation

  11. SAFARI: An Industrial Benchmark for LLM-Assisted Hazard Analysis and Risk Assessment

    Sep 17, 2026Chenxi Wu, Zimu Wang, Haiyang Zhang +2LLM Safety BenchmarksAI Risk Management

  12. Benchmarking LLM Compliance with China AI Generated Content Regulations

    Sep 17, 2026Chenrui Cui, Hongye Fang, Lisha Song +3LLM Safety BenchmarksLLM Alignment

  13. From Intent to Action: Benchmarking LLM Safety in Vehicle Voice Command Authorization

    Sep 17, 2026Diba Afroze, Xingli Zhang, Yazhou Tu +1LLM Safety BenchmarksLLM Safety Evaluation

  14. Japanese Stroke LLM Evaluation: A Conversational Benchmark for Safe Stroke Care in Japanese Using Large Language Models

    Sep 15, 2026Keisuke Masuda, Kazutaka Yatsushiro, Hirohumi Iwamoto +2LLM Safety BenchmarksHealthcare

  15. K-Bench: a clinically calibrated benchmark for evaluating large language models in high-risk mental health conversations

    Sep 14, 2026Laura M. Vowels, Matthew J. Vowels, Shivali Sharma +9LLM Safety BenchmarksMental Health Counseling

  16. DeFiFlowBench: Benchmarking and Improving Safe Executability in Natural-Language DeFi Workflow Synthesis

    Sep 11, 2026Abhinav Rajeev Kumar, Harshit Arora, Varun Singh +1LLM Safety BenchmarksLLM Guardrails

  17. RAG-Safety-Bench: Reliable Evaluation of Retrieval-Augmented LLM Safety

    Sep 11, 2026Adithiyan Rajan Indira Saravanan, Kathleen C. FraserLLM Safety BenchmarksLLM Safety

  18. Measuring LLM Sycophancy under Sustained Multi-Turn Pressure

    Sep 8, 2026Leyuan Tang, Kangda Wei, Tianyu Jiang +1LLM Safety BenchmarksLLM Evaluation

  19. Style Over Substance: Content-Invariant Wrappers Flip LLM Safety-Judge Verdicts

    Sep 8, 2026Yongxi Zhou, Wenbo Ye, Yuanzhe Liu +2LLM Safety BenchmarksLLM-as-a-Judge

  20. SAFIRE: Safety-Critical Benchmark for Fine-grained Fire and Smoke Understanding in Multimodal LLMs

    Sep 7, 2026Pengfei Li, Naufal Suryanto, Sicheng Zhang +2LLM Safety BenchmarksLLM Safety Evaluation

  21. FLY-EVAL++: An Evidence-Driven Evaluation Protocol for Safety-Constrained Flight Prediction with Large Language Models

    Sep 3, 2026Yalun Wu, Junfeng Fang, Jiawei Wang +6LLM Safety BenchmarksLLM Safety Evaluation

  22. Evaluating Criterion-Conditioned Behaviour of Large Language Models in Content Moderation

    Sep 3, 2026Danting Zhang, Bei Peng, Robert LoftinLLM Safety BenchmarksLLM Evaluation

  23. IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks

    Sep 3, 2026Saikat Mondal, Mamta, Deeksha Varshney +2LLM Safety BenchmarksMultilingual Language Model Evaluation

  24. FUSE: An Evaluating Framework for Dangerous Capabilities of LLMs

    Sep 2, 2026Zhengyi Jin, Ru Zhang, Xiao Chen +5LLM Safety BenchmarksJailbreak Robustness