Language Model Safety Evaluation

Latest papers 347

All topics
CardsList
  1. TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages

    May 31, 2026Victor Akinode, Senyu Li, Wassim Hamidouche +3LLM Safety BenchmarksMultilingual Language Model Evaluation

  2. Quantifying the Salience of Geo-Cultural Values for Pluralistic Safety Alignment

    May 29, 2026Arkadiy Saakyan, Charvi Rastogi, Lora AroyoLanguage Model Safety EvaluationCultural Alignment

  3. LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories

    May 29, 2026Krishnapriya Vishnubhotla, Sowmya Vajjala, Akriti Vij +1Multilingual Language Model EvaluationLLM-as-a-Judge

  4. RealityTest: How People Probe AI Identity and Whether Models Disclose It

    May 29, 2026Anna Gausen, Sarenne Wallbridge, Bessie O'Dell +2LLM EvaluationLanguage Model Safety Evaluation

  5. EUDAIMONIA: Evaluating Undesirable Dynamics in AI

    May 28, 2026Jun Rui Huang, Wang Bill Zhu, Ziyi Liu +3LLM AlignmentLanguage Model Safety Evaluation

  6. Configurable Reward Model for Balanced Safety Alignment

    May 28, 2026Zhengping Jiang, Mehran Khodabandeh, Akash Bharadwaj +5Reward ModelingLanguage Model Safety Evaluation

  7. FinGuard: Detecting Financial Regulatory Non-Compliance in LLM Interactions

    May 28, 2026Huaixia Dou, Jie Zhu, Minghao Wu +5Language Model Safety EvaluationLLM Guardrails

  8. When LLMs Learn to Be Consistently Wrong: A Multi-Model Study of Linear Representations of Synthetic Deception

    May 28, 2026Vahideh ZolfaghariLinear ProbingLanguage Model Safety Evaluation

  9. Position: Retire the "Positive Backdoor" Label -- Secret Alignment Requires Strict and Systematic Evaluation

    May 27, 2026Jianwei Li, Jung-Eun KimLLM Backdoor AttacksLanguage Model Safety Evaluation

  10. Models That Know How Evaluations Are Designed Score Safer

    May 27, 2026Katharina Deckenbach, Haritz Puerto, Jonas Geiping +1Language Model Safety EvaluationAI Safety Evaluation

  11. The Fragility of Chain-of-Thought Monitoring Across Typologically Diverse Languages

    May 27, 2026Eric Onyame, Runtao Zhou, Kowshik Thopalli +2CoT FaithfulnessMultilingual Language Model Evaluation

  12. Efficient Safety Benchmarking via Item Response Theory

    May 26, 2026Fabio Spagliardi, Mírian Silva, Ayan Datta +3LLM Safety BenchmarksLanguage Model Safety Evaluation

  13. Detecting Is Not Resolving: The Monitoring Control Gap in Retrieval Augmented LLMs

    May 26, 2026Zhe Yu, Wenpeng Xing, Chen Ye +4Language Model Safety EvaluationKnowledge Conflicts in Language Models

  14. Prompt Injection Detection is Regime-Dependent: A Deployment-Aware Evaluation with Interpretable Structural Signals

    May 26, 2026Akindoyin Akinrele, Shreyank N GowdaLanguage Model Safety EvaluationPrompt Injection Attacks on LLMs

  15. AlbanianLLMSafety: A Safety Evaluation Dataset for Large Language Models in Albanian

    May 26, 2026Wajdi Zaghouani, Kholoud K. Aldous, Isra FejzullajLLM Safety BenchmarksLanguage Model Safety Evaluation

  16. KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models

    May 26, 2026Wajdi Zaghouani, Shimaa Amer Ibrahim, Aruzhan Muratbek +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  17. D2D^2-Monitor: Dynamic Safety Monitoring for Diffusion LLMs via Hesitation Signals

    May 25, 2026Aoxi Liu, Yupeng Chen, James Oldfield +5Language Model Safety EvaluationLLM Safety

  18. StructBreak: Structural Cognitive Overload-Induced Safety Failures in MLLMs

    May 25, 2026Yang Luo, Xinran Liu, Tiantian Ji +3Adversarial Attacks on VLMsLanguage Model Safety Evaluation