Language Model Safety Evaluation

Latest papers 347

All topics
CardsList
  1. SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing

    Jun 29, 2026Jiacheng Zhang, Haoyu He, Sen Zhang +5LLM Safety BenchmarksLanguage Model Safety Evaluation

  2. CAREBench: A Child-Safety Risk Benchmark for Language Models

    Jun 29, 2026Kaavya Krishna-Kumar, Elaine Lau, Vaughn Robinson +6LLM Safety BenchmarksLanguage Model Safety Evaluation

  3. Mechanistically Eliciting Latent Behaviors in Language Models

    Jun 28, 2026Andrew Mack, Nina Panickssery, Alexander Matt TurnerLLM AlignmentLanguage Model Safety Evaluation

  4. The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning

    Jun 27, 2026Will Hawkins, Kaivalya Rawal, Jonathan Rystrøm +8LLM Safety BenchmarksMultilingual Language Model Evaluation

  5. Agent Safety Is Action Alignment

    Jun 27, 2026Shawn Li, Yue ZhaoLanguage Model Safety EvaluationAI Alignment

  6. ToxiREX: A Dataset on Toxic REasoning in ConteXt

    Jun 26, 2026Stefan F. Schouten, Ilia Markov, Piek VossenLanguage Model Safety EvaluationToxicity Detection

  7. The Inattentional Gap: Task-Conditioned Language and Vision Models Omit the Safety-Critical Signals They Can Otherwise Report

    Jun 25, 2026Kwan Soo Shin, In Seok Kang, Yunkyung Min +2Language Model Safety EvaluationAI Safety Evaluation

  8. Manipulation Is Task-Dependent: A Multi-Axis, Multi-Environment Evaluation of Frontier LLMs

    Jun 24, 2026Adeeb Zaman, Erik Nordby, Fred HeidingLLM EvaluationLanguage Model Safety Evaluation

  9. Long-Term Simulation Exposes Cognitive-Developmental Risks in AI Companions

    Jun 24, 2026Kaicheng Shen, Lingyu Li, Wen Wu +3Language Model Safety EvaluationLong-Horizon Agent Evaluation

  10. A Survey of Toxicity Detection and Mitigation Strategies for Multilingual Language Models

    Jun 24, 2026Soham Dan, Himanshu Beniwal, Thomas HartvigsenMultilingual Language ModelsLLM Alignment

  11. Evaluation Awareness Is Not One Capability: Evidence from Open Language Models

    Jun 22, 2026Nilesh Nayan, Aishwarya Sampath Kumar, Rishiraj Girmal +5Language Model Safety EvaluationLLM Interpretability

  12. Measuring & Mitigating Over-Alignment for LLMs in Multilingual Criminal Law Courts

    Jun 22, 2026Arthur Wuhrmann, Gaetan Stein, Daniel Brunner +1Multilingual Language Model EvaluationLegal NLP

  13. FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming

    Jun 18, 2026Chaeyun Kim, Daeyoung Park, Junghwan Kim +4LLM Safety BenchmarksFinancial Services

  14. The Wrong Kind of Right: Quantifying and Localizing Misfired Alignment in LLMs

    Jun 17, 2026Naihao Deng, Yiming Feng, Chimaobi Okite +4LLM GroundingLLM Alignment

  15. A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models

    Jun 16, 2026Nicola FrancoLanguage Model Safety EvaluationNeural Network Robustness

  16. AuAu: A Benchmark for Auditing Authoritarian Alignment in Large Language Models

    Jun 15, 2026Andreas Einwiller, Max Klabunde, Florian LemmerichLanguage Model Safety EvaluationLLM Auditing

  17. On Defining Erasure Harms for NLP

    Jun 14, 2026Yu Lu Liu, Arnav Goel, Jackie Chi Kit Cheung +3Language Model Safety Evaluation

  18. CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment

    Jun 13, 2026Wenbo Yu, Bohua Wang, Hao Fang +10LLM Safety BenchmarksLanguage Model Safety Evaluation

  19. Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds

    Jun 13, 2026Ömer Veysel Çağatan, Xuandong ZhaoReward HackingLanguage Model Safety Evaluation

  20. I'm Sorry Driver, I'm Afraid I Can't Do That: Appraising the Safety of LLMs within Automotive Contexts

    Jun 12, 2026Shaun Feakins, Ibrahim Habli, Kim Littler +1Language Model-Based ControlLanguage Model Safety Evaluation