LLM Safety Benchmarks

LLM: Large Language Model

Momentum

23 papers in the last four weeks, up 44% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 141

All topics
CardsList
  1. How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense

    Oct 7, 2026Zhankai Ye, Yanning Wang, Yukai Jin +5Refusal Behavior in Language ModelsLLM Safety Alignment

  2. The Pushback Paradox: A Two-Probe Diagnostic for Language Model Compliance

    Oct 5, 2026Stefan Bühler, David Exler, Markus Reischl +1LLM Safety BenchmarksLanguage Model Safety Evaluation

  3. OpenMTB-Audit: Exposing Over-Refusal and Clinical Expert Perspectives in LLM-Based Molecular Tumor Board Safety Evaluation

    Oct 1, 2026Negin Ashrafi, Jia Luo, Stacey M. Frumm +1LLM Safety BenchmarksLLM Auditing

  4. RGDT-Bench: Benchmarking LLM Reasoning for Rule-Governed Decisions and Their Justifications

    Sep 28, 2026Jianpeng Zhao, Haihua Xu, Haoyang Zhang +7LLM Safety BenchmarksLLM Decision-Making

  5. Safety Reconstructed: Generative Modeling via Masked Diffusion Builds Strong Safety Guardrails

    Sep 27, 2026Gert Lek, Abele Malan, Chaoyi Zhu +3LLM Safety BenchmarksLLM Guardrails

  6. Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures

    Sep 24, 2026Ruoqi Guo, Yi Liu, Gelei Deng +6LLM Safety BenchmarksLLM Alignment

  7. ArGuard Shared Task: Harmful Content Detection in Arabic Memes and LLM Prompts

    Sep 24, 2026Firoj Alam, Md. Rafiul Biswas, Mohamed Bayan Kmainasi +5LLM Safety BenchmarksArabic NLP

  8. IndicBankBench: Evaluating Safety and Reliability of Language Model Assistants in Indian Retail Banking

    Sep 24, 2026Suvradip Paul, Chandra Bhushan, Harsh Sharma +4LLM Safety BenchmarksFinancial Services

  9. EADC: Evaluation of Advanced and Deep-level Compliance in Large Language Models

    Sep 22, 2026Yan Zhang, Ruien Li, Yaoyao Peng +4LLM Safety BenchmarksLLM Evaluation

  10. SSP-Bench: A Hybrid Data Generation Framework for Safety, Security, and Privacy Evaluation

    Sep 21, 2026Fatih Deniz, Yazan Boshmaf, Issa KhalilLLM Safety BenchmarksLLM Evaluation

  11. SAFARI: An Industrial Benchmark for LLM-Assisted Hazard Analysis and Risk Assessment

    Sep 17, 2026Chenxi Wu, Zimu Wang, Haiyang Zhang +2LLM Safety BenchmarksAI Risk Management

  12. Benchmarking LLM Compliance with China AI Generated Content Regulations

    Sep 17, 2026Chenrui Cui, Hongye Fang, Lisha Song +3LLM Safety BenchmarksLLM Alignment

  13. From Intent to Action: Benchmarking LLM Safety in Vehicle Voice Command Authorization

    Sep 17, 2026Diba Afroze, Xingli Zhang, Yazhou Tu +1LLM Safety BenchmarksLLM Safety Evaluation

  14. Japanese Stroke LLM Evaluation: A Conversational Benchmark for Safe Stroke Care in Japanese Using Large Language Models

    Sep 15, 2026Keisuke Masuda, Kazutaka Yatsushiro, Hirohumi Iwamoto +2LLM Safety BenchmarksHealthcare

  15. K-Bench: a clinically calibrated benchmark for evaluating large language models in high-risk mental health conversations

    Sep 14, 2026Laura M. Vowels, Matthew J. Vowels, Shivali Sharma +9LLM Safety BenchmarksMental Health Counseling

  16. RAG-Safety-Bench: Reliable Evaluation of Retrieval-Augmented LLM Safety

    Sep 11, 2026Adithiyan Rajan Indira Saravanan, Kathleen C. FraserLLM Safety BenchmarksLLM Safety

  17. DeFiFlowBench: Benchmarking and Improving Safe Executability in Natural-Language DeFi Workflow Synthesis

    Sep 11, 2026Abhinav Rajeev Kumar, Harshit Arora, Varun Singh +1LLM Safety BenchmarksLLM Guardrails

  18. Measuring LLM Sycophancy under Sustained Multi-Turn Pressure

    Sep 8, 2026Leyuan Tang, Kangda Wei, Tianyu Jiang +1LLM Safety BenchmarksLLM Evaluation

  19. Style Over Substance: Content-Invariant Wrappers Flip LLM Safety-Judge Verdicts

    Sep 8, 2026Yongxi Zhou, Wenbo Ye, Yuanzhe Liu +2LLM Safety BenchmarksLLM-as-a-Judge

  20. SAFIRE: Safety-Critical Benchmark for Fine-grained Fire and Smoke Understanding in Multimodal LLMs

    Sep 7, 2026Pengfei Li, Naufal Suryanto, Sicheng Zhang +2LLM Safety BenchmarksLLM Safety Evaluation

  21. FLY-EVAL++: An Evidence-Driven Evaluation Protocol for Safety-Constrained Flight Prediction with Large Language Models

    Sep 3, 2026Yalun Wu, Junfeng Fang, Jiawei Wang +6LLM Safety BenchmarksLLM Safety Evaluation

  22. Evaluating Criterion-Conditioned Behaviour of Large Language Models in Content Moderation

    Sep 3, 2026Danting Zhang, Bei Peng, Robert LoftinLLM Safety BenchmarksLLM Evaluation

  23. IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks

    Sep 3, 2026Saikat Mondal, Mamta, Deeksha Varshney +2LLM Safety BenchmarksMultilingual Language Model Evaluation

  24. FUSE: An Evaluating Framework for Dangerous Capabilities of LLMs

    Sep 2, 2026Zhengyi Jin, Ru Zhang, Xiao Chen +5LLM Safety BenchmarksJailbreak Robustness

  25. SDARE-Bench: Evaluating Large Language Models on Conversational Stigma Detection and Response in Dyadic and Group Dialogue

    Sep 1, 2026Stephanie Fong, Yiwen Jiang, Zimu Wang +12LLM Safety BenchmarksSocial Bias in Language Models

  26. CopyShield: A Cross-Level Benchmark of Copyright Defenses in LLMs

    Sep 1, 2026Maryam Alshehyari, Dushyant Singh Chauhan, Samuele Poppi +3LLM Safety BenchmarksDirect Preference Optimization

  27. WildSEEK: Evaluating Language Models for Information-Seeking

    Aug 31, 2026Tanise Ceron, Joachim Baumann, Elisa Bassignana +3LLM Safety BenchmarksLLM Sycophancy

  28. Beyond Semantic Accuracy: Consequence-Aware Evaluation for Safety-Critical Language Understanding

    Aug 25, 2026Yujing Chang, Thinh Pham, Van-Phat Thai +4LLM Safety BenchmarksLLM Evaluation

  29. Stress Testing Unlearning Algorithms

    Aug 23, 2026Noam Diamant, Neta Glazer, Ethan FetayaLLM Safety BenchmarksMachine Unlearning

  30. Evaluating Large Language Model Performance on International Maritime Dangerous Goods Code Compliance

    Aug 21, 2026Alexander Thomas, Hubert P. H. Shum, Darren Nellis +4LLM Safety BenchmarksLanguage Model Safety Evaluation

  31. AeroCopilotBench: Safety-Gated Evaluation of LLM Agents on Aircraft Emergency Procedures in an Executable Cockpit

    Aug 17, 2026Yuchen Yuan, Zhenghuang Wu, Yuangan Li +2LLM Safety BenchmarksAI Agent Safety Benchmarks

  32. TAF-MED: Multi-Turn Safety Refusal Collapse in LLMs Under Declared Self-Treatment Intent

    Aug 10, 2026Waleed Jamil, Raphael SchmittLLM Safety BenchmarksLLM Safety Evaluation

  33. ELBench: A Multi-Dimensional Benchmark for Education-Facing Large Language Models

    Aug 10, 2026Yilin Jiang, Xiaorong Zhu, Fei Tan +9LLM Safety BenchmarksLLM Evaluation

  34. When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs

    Aug 9, 2026Yu Ma, Hongli Shi, Jing Li +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  35. SurakshaEval: An Indic Safety Benchmark for Multilingual LLMs

    Aug 8, 2026Debopriyo Banerjee, Kapil Rajesh Kavitha, Angana Borah +11LLM Safety BenchmarksMultilingual Language Model Evaluation

  36. What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)

    Aug 6, 2026Ro Encarnación, Tina Behzad, Emma Lurie +1LLM Safety BenchmarksLLM Evaluation

  37. From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs

    Aug 6, 2026Jiawei Qiu, Yichen Xu, Jianzhe Ma +5LLM Safety BenchmarksLanguage Model Safety Evaluation

  38. Item Response Theory for AI Safety

    Aug 5, 2026Joshua Fonseca Rivera, Neil Shah, David Demitri Africa +1LLM Safety BenchmarksLanguage Model Safety Evaluation

  39. DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots

    Aug 5, 2026Jared Moore, Andrea Mock, Yifan Mai +9LLM Safety BenchmarksLLM Safety

  40. Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings

    Aug 5, 2026Agatha Duzan, Asa Cooper SticklandLLM Safety BenchmarksCoT Monitoring

  41. RESPClinBench: Benchmarking Multimodal Clinical Decision-Making and Longitudinal Disease Management in Respiratory Specialty Care

    Aug 5, 2026Mouxiao Bian, Zhi Chen, Ruiyao Chen +8LLM Safety BenchmarksHealthcare

  42. CARE-Bench: Benchmarking Patient-Facing LLM Triage

    Aug 4, 2026Yining Hua, Hongbin Na, Cyrus AyubchaLLM Safety BenchmarksClinical Triage

  43. onepot-Bench 0: towards lab-aware in silico chemistry benchmarks

    Aug 3, 2026Brandon Wang, Andrei S. Tyrin, Daniil A. BoikoLLM Safety BenchmarksLLM Evaluation

  44. MedPRESS: A Multi-turn Benchmark for Patient-Pressure-Induced Medical Sycophancy in LLMs

    Aug 3, 2026Saman Sarker Joy, Niloy FarhanLLM Safety BenchmarksLLM Sycophancy

  45. EduZone: A Framework for Evaluating LLM Safety for K-12 Students and Teachers

    Aug 3, 2026Junyeong Park, Jieun Han, Haneul Yoo +3LLM Safety BenchmarksGenerative AI in Education

  46. A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models

    Aug 3, 2026Shu Quan, Tianfang Hao, Sitong Fang +8LLM Safety BenchmarksLLM Safety

  47. ArabicDialectSafety: A Dialect-Aware Benchmark for Arabic Content Safety Classification

    Aug 2, 2026Wajdi Zaghouani, Md. Rafiul Biswas, Kholoud Khalil Aldous +1LLM Safety BenchmarksArabic NLP