Language Model Safety Evaluation

Latest papers 347

All topics
CardsList
  1. Searching for "Harmful Refusal": A Psychometric Audit of an AI Safety Benchmark

    Oct 8, 2026Christopher M. Stewart, Preston Botter, Natalie Sarabosing +5LLM Safety BenchmarksLanguage Model Safety Evaluation

  2. One Word Opens the Gate: The Option-Channel Attack on Typed Decision Models as Agent Guardrails

    Oct 8, 2026Seyedarmin Azizi, Erfan Baghaei Potraghloo, Massoud PedramLLM GuardrailsLLM Agent Security

  3. ReSI: Recursive Safety Improvement toward Resistant and Resilient AI

    Oct 8, 2026Jingnan Zheng, Dongcheng Zhang, Yi Zhang +10LLM Safety AlignmentRecursive Self-Improvement

  4. Same Outcome, Different Evidence: Intent Recovery in LLM Safety Evaluation

    Oct 8, 2026Haitong Jiang, Chunlin Liu, Sihan Tang +3Language Model Safety Evaluation

  5. How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense

    Oct 7, 2026Zhankai Ye, Yanning Wang, Yukai Jin +5Refusal Behavior in Language ModelsLLM Safety Alignment

  6. PatchBench: Measuring Collateral Damage in Activation Patching

    Oct 7, 2026Alexi Canesse, Mathis Le Bail, Maël Jenny +3Language Model Safety EvaluationJailbreak Defense

  7. Not Every Call Needs a Frontier Model: Per-Call-Site Evaluation of Small Language Models in a Deployed Agentic Home-Automation System

    Oct 6, 2026Panagiotis Kasnesis, Christos Chatzigeorgiou, Lazaros Toumanidis +1Small Language ModelsLLM Agent Evaluation

  8. Does Steering Break Your Model? A Multi-Dimensional Evaluation Suite for LLM Steering Methods

    Oct 6, 2026Haotian Yang, Huikang Jiang, Yucheng Wu +4LLM EvaluationLanguage Model Steering

  9. The Pushback Paradox: A Two-Probe Diagnostic for Language Model Compliance

    Oct 5, 2026Stefan Bühler, David Exler, Markus Reischl +1LLM Safety BenchmarksLanguage Model Safety Evaluation

  10. AI Safety via Debate is Compromised by Cognitive Biases

    Oct 4, 2026Gefei Liu, Sonya Rashkovan, Sophia Lloyd George +2Language Model Safety EvaluationAI Safety

  11. ContextAdapt: Evaluating Contextual Adaptation and Value Alignment in LLMs

    Sep 29, 2026Olivia Macmillan-Scott, Mirco MusolesiLLM AlignmentLanguage Model Safety Evaluation

  12. Language Models Are "Insecure" Reporters

    Sep 28, 2026Jenny Y. Huang, Jiameng Fan, Ahmed Imtiaz Humayun +5Language Model Safety EvaluationDeception in Language Models

  13. Less Sycophancy, Stronger Refusal? Lessons for AI Safety from Mechanistic Interpretability

    Sep 28, 2026Xu Wang, Difan Zou, Xuansheng WuLLM SycophancyLanguage Model Safety Evaluation

  14. Tool Mediation Alters Refusal Mechanisms in Large Language Models

    Sep 28, 2026Abel Rodríguez, Giuseppe Garofalo, Lieven Desmet +1Language Model Safety EvaluationLLM Agent Safety

  15. When Do Model Internals Help? Exploring the Role of Representation Engineering in LLM Safety

    Sep 28, 2026Tianyi Guan, Jianhui Chen, Liangming PanLanguage Model Safety EvaluationLLM Interpretability

  16. Quantifying Behavioral Tails in Black-Box Language Models

    Sep 27, 2026Elsayed Eshra, Ali Al-Lawati, Dongwon Lee +1Language Model Safety EvaluationLLM Safety

  17. ArGuard Shared Task: Harmful Content Detection in Arabic Memes and LLM Prompts

    Sep 24, 2026Firoj Alam, Md. Rafiul Biswas, Mohamed Bayan Kmainasi +5LLM Safety BenchmarksArabic NLP