Language Model Safety Evaluation

Latest papers 347

All topics
CardsList
  1. Benchmarking LLM Compliance with China AI Generated Content Regulations

    Sep 17, 2026Chenrui Cui, Hongye Fang, Lisha Song +3LLM Safety BenchmarksLLM Alignment

  2. Full-Duplex Speech Models Take the Floor When Asked, Not When Needed

    Sep 17, 2026Linkai Peng, Baorian Nuchged, Kaiqi Fu +1Language Model Safety EvaluationSpoken Dialogue Systems

  3. K-Bench: a clinically calibrated benchmark for evaluating large language models in high-risk mental health conversations

    Sep 14, 2026Laura M. Vowels, Matthew J. Vowels, Shivali Sharma +9LLM Safety BenchmarksMental Health Counseling

  4. HazardAuditor: From Executable Threats to Safer Computer-Use Agents

    Sep 14, 2026Yunhao Feng, Ruixiao Lin, Ming Wen +5Language Model Safety EvaluationAI Agent Auditing

  5. SoK: Rethinking Jailbreaking in the Era of Agentic AI: Attacks, Defenses, and Practical Consideration

    Sep 14, 2026Md Jueal Mia, Yanzhao Wu, Selcuk Uluagac +1Language Model Safety EvaluationJailbreak Robustness

  6. Semantic Fibers and Cross-Gram Interference: A Calculus of Safety Drift in Overcomplete Representations

    Sep 14, 2026Mohammed Ahnouch, Lotfi ElaachackLanguage Model Safety EvaluationLLM Safety

  7. DuplexJail: Spoken Interruption Attacks on Full-Duplex Speech Models

    Sep 8, 2026Jaechul Roh, Deepak Chandran, Amir Houmansadr +1Language Model Safety EvaluationJailbreak Attacks

  8. Style Over Substance: Content-Invariant Wrappers Flip LLM Safety-Judge Verdicts

    Sep 8, 2026Yongxi Zhou, Wenbo Ye, Yuanzhe Liu +2LLM Safety BenchmarksLLM-as-a-Judge

  9. The Profit Alignment Problem: How Profit Mandates Induce Alignment Failures in LLMs

    Sep 7, 2026Eric SoLLM AlignmentLanguage Model Safety Evaluation

  10. Validity-Aware Jailbreak Evaluation for Large Language Models

    Aug 31, 2026Qilong Wu, Sahil Wadhwa, Pranab Mohanty +2Language Model Safety EvaluationLLM Auditing

  11. Beyond Token Positions: Safety Alignment Across Denoising Steps in Diffusion Language Models

    Aug 31, 2026Guoli Wang, Haonan Shi, Tu Ouyang +1Language Model Safety EvaluationDiffusion Language Model Decoding

  12. Capability-Gated Language Models: Security Composes, Utility Does Not

    Aug 31, 2026Patrikas Vanagas, Augustas Mačijauskas, Laurynas LopataLanguage Model Safety EvaluationLLM Security

  13. The Fragility of Jailbreak Robustness Across Operational States

    Aug 31, 2026Yuna Park, Hwang Youn Kim, Yujin Kim +3Prompt SensitivityLanguage Model Safety Evaluation

  14. SingProbe Technical Report

    Aug 31, 2026Sing TeamLanguage Model Safety EvaluationLLM Guardrails

  15. WildSEEK: Evaluating Language Models for Information-Seeking

    Aug 31, 2026Tanise Ceron, Joachim Baumann, Elisa Bassignana +3LLM Safety BenchmarksLLM Sycophancy

  16. LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails

    Aug 27, 2026Ziyang Chen, Xing Wu, Songlin HuLanguage Model Safety EvaluationLong-Context Language Model Evaluation

  17. Beyond Semantic Accuracy: Consequence-Aware Evaluation for Safety-Critical Language Understanding

    Aug 25, 2026Yujing Chang, Thinh Pham, Van-Phat Thai +4LLM Safety BenchmarksLLM Evaluation

  18. Hidden in the Request: Explaining Unethical LLM Compliance through Token Relevance

    Aug 24, 2026Or Biton, Tomer Krichli, Itai Allouche +1Language Model DecodingLanguage Model Safety Evaluation

  19. Evaluating Large Language Model Performance on International Maritime Dangerous Goods Code Compliance

    Aug 21, 2026Alexander Thomas, Hubert P. H. Shum, Darren Nellis +4LLM Safety BenchmarksLanguage Model Safety Evaluation