Language Model Safety Evaluation

Latest papers 347

All topics
CardsList
  1. TriBench-Ko: Evaluating LLM Risks in Judicial Workflows

    May 5, 2026Haesung Lee, Gyubin Choi, Eun-Ju Lee +5LLM EvaluationLanguage Model Safety Evaluation

  2. Exposing LLM Safety Gaps Through Mathematical Encoding:New Attacks and Systematic Analysis

    May 5, 2026Haoyu Zhang, Mohammad Zandsalimy, Shanu SushmitaLanguage Model Safety EvaluationAdversarial Attacks on LLMs

  3. MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

    May 3, 2026Jialin Song, Xiaodong Liu, Weiwei Yang +4LLM Safety BenchmarksAdversarial Prompt Generation

  4. Artificial intelligence language technologies in multilingual healthcare: Grand challenges ahead

    May 2, 2026Vicent Briva-IglesiasMultilingual Language Model EvaluationLanguage Model Safety Evaluation

  5. FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios

    May 1, 2026Yutao Hou, Yihan Jiang, Yuhan Xie +5Multilingual Language Model EvaluationLanguage Model Safety Evaluation

  6. BabelSafe: A Policy-Grounded Multilingual Safety Benchmark for LLMs

    May 1, 2026Yunhan Zhao, Zhaorun Chen, Xingjun Ma +1LLM Safety BenchmarksMultilingual Language Models

  7. ReLay: Personalized LLM-Generated Plain-Language Summaries for Better Understanding, but at What Cost?

    May 1, 2026Joey Chan, Yikun Han, Jingyuan Chen +8LLM PersonalizationLanguage Model Safety Evaluation

  8. Characterizing the Consistency of the Emergent Misalignment Persona

    Apr 30, 2026Anietta Weckauff, Yuchen Zhang, Maksym AndriushchenkoLanguage Model Safety EvaluationPersona Consistency

  9. Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations

    Apr 29, 2026Mingqian Zheng, Malia Morgan, Liwei Jiang +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  10. Dynamic Adversarial Fine-Tuning Reorganizes Refusal Geometry

    Apr 29, 2026Wenhao Lan, Shan Li, Xinhua Lai +4Adversarial TrainingLanguage Model Safety Evaluation

  11. Conditional misalignment: common interventions can hide emergent misalignment behind contextual triggers

    Apr 28, 2026Jan Dubiński, Jan Betley, Anna Sztyber-Betley +2Language Model Safety EvaluationEmergent Misalignment in Language Models

  12. Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment

    Apr 28, 2026James Pustejovsky, Nikhil KrishnaswamyRL for Language ModelsLanguage Model Safety Evaluation

  13. Evaluating whether AI models would sabotage AI safety research

    Apr 27, 2026Robert Kirk, Alexandra Souly, Kai Fronsdal +2Language Model Safety EvaluationLLM Auditing

  14. How Sensitive Are Safety Benchmarks to Judge Configuration Choices?

    Apr 27, 2026Xinran ZhangLLM Safety BenchmarksLLM-as-a-Judge

  15. Semantic Denial of Service in LLM-controlled robots

    Apr 25, 2026Jonathan Steinberg, Oren GalLanguage Model Safety EvaluationAdversarial Attacks on LLMs

  16. Estimating Tail Risks in Language Model Output Distributions

    Apr 24, 2026Rico Angell, Raghav Singhal, Zachary Horvitz +4Language Model Safety EvaluationImportance Sampling

  17. Value-Conflict Diagnostics Reveal Widespread Alignment Faking in Language Models

    Apr 22, 2026Inderjeet Nair, Jie Ruan, Lu WangLLM AlignmentLanguage Model Safety Evaluation