Language Model Safety Evaluation

Latest papers 343

All topics
CardsList
  1. How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense

    Oct 7, 2026Zhankai Ye, Yanning Wang, Yukai Jin +5Refusal Behavior in Language ModelsLLM Safety Alignment

  2. PatchBench: Measuring Collateral Damage in Activation Patching

    Oct 7, 2026Alexi Canesse, Mathis Le Bail, Maël Jenny +3Language Model Safety EvaluationJailbreak Defense

  3. Not Every Call Needs a Frontier Model: Per-Call-Site Evaluation of Small Language Models in a Deployed Agentic Home-Automation System

    Oct 6, 2026Panagiotis Kasnesis, Christos Chatzigeorgiou, Lazaros Toumanidis +1Small Language ModelsLLM Agent Evaluation

  4. Does Steering Break Your Model? A Multi-Dimensional Evaluation Suite for LLM Steering Methods

    Oct 6, 2026Haotian Yang, Huikang Jiang, Yucheng Wu +4LLM EvaluationLanguage Model Steering

  5. The Pushback Paradox: A Two-Probe Diagnostic for Language Model Compliance

    Oct 5, 2026Stefan Bühler, David Exler, Markus Reischl +1LLM Safety BenchmarksLanguage Model Safety Evaluation

  6. AI Safety via Debate is Compromised by Cognitive Biases

    Oct 4, 2026Gefei Liu, Sonya Rashkovan, Sophia Lloyd George +2Language Model Safety EvaluationAI Safety

  7. ContextAdapt: Evaluating Contextual Adaptation and Value Alignment in LLMs

    Sep 29, 2026Olivia Macmillan-Scott, Mirco MusolesiLLM AlignmentLanguage Model Safety Evaluation

  8. Language Models Are "Insecure" Reporters

    Sep 28, 2026Jenny Y. Huang, Jiameng Fan, Ahmed Imtiaz Humayun +5Language Model Safety EvaluationDeception in Language Models

  9. Less Sycophancy, Stronger Refusal? Lessons for AI Safety from Mechanistic Interpretability

    Sep 28, 2026Xu Wang, Difan Zou, Xuansheng WuLLM SycophancyLanguage Model Safety Evaluation

  10. Tool Mediation Alters Refusal Mechanisms in Large Language Models

    Sep 28, 2026Abel Rodríguez, Giuseppe Garofalo, Lieven Desmet +1Language Model Safety EvaluationLLM Agent Safety

  11. When Do Model Internals Help? Exploring the Role of Representation Engineering in LLM Safety

    Sep 28, 2026Tianyi Guan, Jianhui Chen, Liangming PanLanguage Model Safety EvaluationLLM Interpretability

  12. Quantifying Behavioral Tails in Black-Box Language Models

    Sep 27, 2026Elsayed Eshra, Ali Al-Lawati, Dongwon Lee +1Language Model Safety EvaluationLLM Safety

  13. ArGuard Shared Task: Harmful Content Detection in Arabic Memes and LLM Prompts

    Sep 24, 2026Firoj Alam, Md. Rafiul Biswas, Mohamed Bayan Kmainasi +5LLM Safety BenchmarksArabic NLP

  14. Benchmarking LLM Compliance with China AI Generated Content Regulations

    Sep 17, 2026Chenrui Cui, Hongye Fang, Lisha Song +3LLM Safety BenchmarksLLM Alignment

  15. Full-Duplex Speech Models Take the Floor When Asked, Not When Needed

    Sep 17, 2026Linkai Peng, Baorian Nuchged, Kaiqi Fu +1Language Model Safety EvaluationSpoken Dialogue Systems