LLM Safety Benchmarks

LLM: Large Language Model

Momentum

23 papers in the last four weeks, up 44% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 141

All topics
CardsList
  1. SDARE-Bench: Evaluating Large Language Models on Conversational Stigma Detection and Response in Dyadic and Group Dialogue

    Sep 1, 2026Stephanie Fong, Yiwen Jiang, Zimu Wang +12LLM Safety BenchmarksSocial Bias in Language Models

  2. CopyShield: A Cross-Level Benchmark of Copyright Defenses in LLMs

    Sep 1, 2026Maryam Alshehyari, Dushyant Singh Chauhan, Samuele Poppi +3LLM Safety BenchmarksDirect Preference Optimization

  3. WildSEEK: Evaluating Language Models for Information-Seeking

    Aug 31, 2026Tanise Ceron, Joachim Baumann, Elisa Bassignana +3LLM Safety BenchmarksLLM Sycophancy

  4. Beyond Semantic Accuracy: Consequence-Aware Evaluation for Safety-Critical Language Understanding

    Aug 25, 2026Yujing Chang, Thinh Pham, Van-Phat Thai +4LLM Safety BenchmarksLLM Evaluation

  5. Stress Testing Unlearning Algorithms

    Aug 23, 2026Noam Diamant, Neta Glazer, Ethan FetayaLLM Safety BenchmarksMachine Unlearning

  6. Evaluating Large Language Model Performance on International Maritime Dangerous Goods Code Compliance

    Aug 21, 2026Alexander Thomas, Hubert P. H. Shum, Darren Nellis +4LLM Safety BenchmarksLanguage Model Safety Evaluation

  7. AeroCopilotBench: Safety-Gated Evaluation of LLM Agents on Aircraft Emergency Procedures in an Executable Cockpit

    Aug 17, 2026Yuchen Yuan, Zhenghuang Wu, Yuangan Li +2LLM Safety BenchmarksAI Agent Safety Benchmarks

  8. TAF-MED: Multi-Turn Safety Refusal Collapse in LLMs Under Declared Self-Treatment Intent

    Aug 10, 2026Waleed Jamil, Raphael SchmittLLM Safety BenchmarksLLM Safety Evaluation

  9. ELBench: A Multi-Dimensional Benchmark for Education-Facing Large Language Models

    Aug 10, 2026Yilin Jiang, Xiaorong Zhu, Fei Tan +9LLM Safety BenchmarksLLM Evaluation

  10. When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs

    Aug 9, 2026Yu Ma, Hongli Shi, Jing Li +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  11. SurakshaEval: An Indic Safety Benchmark for Multilingual LLMs

    Aug 8, 2026Debopriyo Banerjee, Kapil Rajesh Kavitha, Angana Borah +11LLM Safety BenchmarksMultilingual Language Model Evaluation

  12. What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)

    Aug 6, 2026Ro Encarnación, Tina Behzad, Emma Lurie +1LLM Safety BenchmarksLLM Evaluation

  13. From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs

    Aug 6, 2026Jiawei Qiu, Yichen Xu, Jianzhe Ma +5LLM Safety BenchmarksLanguage Model Safety Evaluation

  14. Item Response Theory for AI Safety

    Aug 5, 2026Joshua Fonseca Rivera, Neil Shah, David Demitri Africa +1LLM Safety BenchmarksLanguage Model Safety Evaluation

  15. DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots

    Aug 5, 2026Jared Moore, Andrea Mock, Yifan Mai +9LLM Safety BenchmarksLLM Safety

  16. Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings

    Aug 5, 2026Agatha Duzan, Asa Cooper SticklandLLM Safety BenchmarksCoT Monitoring

  17. RESPClinBench: Benchmarking Multimodal Clinical Decision-Making and Longitudinal Disease Management in Respiratory Specialty Care

    Aug 5, 2026Mouxiao Bian, Zhi Chen, Ruiyao Chen +8LLM Safety BenchmarksHealthcare

  18. CARE-Bench: Benchmarking Patient-Facing LLM Triage

    Aug 4, 2026Yining Hua, Hongbin Na, Cyrus AyubchaLLM Safety BenchmarksClinical Triage

  19. onepot-Bench 0: towards lab-aware in silico chemistry benchmarks

    Aug 3, 2026Brandon Wang, Andrei S. Tyrin, Daniil A. BoikoLLM Safety BenchmarksLLM Evaluation

  20. MedPRESS: A Multi-turn Benchmark for Patient-Pressure-Induced Medical Sycophancy in LLMs

    Aug 3, 2026Saman Sarker Joy, Niloy FarhanLLM Safety BenchmarksLLM Sycophancy

  21. EduZone: A Framework for Evaluating LLM Safety for K-12 Students and Teachers

    Aug 3, 2026Junyeong Park, Jieun Han, Haneul Yoo +3LLM Safety BenchmarksGenerative AI in Education

  22. A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models

    Aug 3, 2026Shu Quan, Tianfang Hao, Sitong Fang +8LLM Safety BenchmarksLLM Safety

  23. ArabicDialectSafety: A Dialect-Aware Benchmark for Arabic Content Safety Classification

    Aug 2, 2026Wajdi Zaghouani, Md. Rafiul Biswas, Kholoud Khalil Aldous +1LLM Safety BenchmarksArabic NLP