Language Model Safety Evaluation

Latest papers 347

All topics
CardsList
  1. Safeguards for Speech2Speech LLM-Assistants: A Case Study in Automotive Applications

    Jul 23, 2026Gregor Endler, Sebastian Kraus, Lukas StappenLanguage Model Safety EvaluationLLM Guardrails

  2. Sound Probabilistic Safety Bounds for Large Language Models

    Jul 22, 2026Mahdi Nazeri, Anne-Kathrin Schmuck, Sadegh Soudjani +1Language Model Safety EvaluationConfidence Estimation in Language Models

  3. An Early Warning of Emerging Biosecurity Risks in Frontier LLMs

    Jul 20, 2026Zhida He, Xia Hu, Baichen Le +20Language Model Safety EvaluationLLM Security

  4. AEGIS: Awareness-Enhanced Guidance for Iterative Safeguard

    Jul 20, 2026Kyungwon Park, Sangmin Lee, Heejae Chon +1Language Model Safety EvaluationText Generation

  5. A Dual-Hypothesis Reasoning Framework for LLM Guardrails

    Jul 20, 2026Md Asiful Islam, Fahmida Alam, Mihai SurdeanuSupervised Fine-TuningLanguage Model Safety Evaluation

  6. LLM Evaluators are Biased across Languages

    Jul 16, 2026Ej Zhou, Lucas Resck, Zheng Hui +1Multilingual Language Model EvaluationLanguage Model Safety Evaluation

  7. Protective Capacity Hallucination: When Large Language Models Claim Nonexistent Capabilities

    Jul 15, 2026Eunna Lee, Jungpyo Nam, Sunjun HwangLanguage Model Safety EvaluationHallucination in Language Models

  8. SAFETY SENTRY: Context-Aware Human Intervention via EXECUTE-ASK-REFUSE Routing

    Jul 15, 2026Tianyu Chen, Chujia Hu, Wenjie WangLanguage Model Safety EvaluationLLM Guardrails

  9. A Threshold Exceedance Framework for CBRN Uplift Evaluation in Frontier Language Models

    Jul 13, 2026Rahul Gupta, Abhinav Mohanty, Payal Motwani +8Language Model Safety Evaluation

  10. Trivial Prompt Reframing Bypasses Safety Guardrails in Googleś MedGemma-4B

    Jul 9, 2026Avi-ad Avraam BuskilaLLM Safety BenchmarksLanguage Model Safety Evaluation

  11. Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring

    Jul 9, 2026Jennifer Za, Julija Bainiaksina, Nikita Ostrovsky +2Language Model Safety EvaluationAdversarial Attacks on LLMs

  12. Predicting LLM Safety Before Release by Simulating Deployment

    Jul 8, 2026Marcus Williams, Hannah Sheahan, Cameron Raymond +8LLM EvaluationAI Risk Management

  13. Online Safety Monitoring for LLMs

    Jul 2, 2026Mona Schirmer, Metod Jazbec, Alexander Timans +3Language Model Safety EvaluationLLM Safety

  14. HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety

    Jul 2, 2026Navaneeth Sangameswaran, Preetham S, Ashmiya LeninLLM Safety BenchmarksLanguage Model Safety Evaluation

  15. OpenSafeIntent: Evaluating Intent-Calibrated Safe Completion Across Dual-Use Prompt Sets

    Jul 2, 2026Rheeya Uppaal, Seungwoo Lyu, Selina Sung +1LLM Safety BenchmarksLanguage Model Safety Evaluation

  16. Moral Safety in LLMs: Exposing Performative Compliance with Puzzled Cues

    Jun 30, 2026Mohammadamin Shafiei, Shuyue Stella Li, Yulia TsvetkovLanguage Model Safety EvaluationLanguage Model Bias Evaluation