Language Model Safety Evaluation

Latest papers 347

All topics
CardsList
  1. Inverting the Shield: Systematically Generating Safety Tests from Policy Specifications

    May 24, 2026Xiaoyue Lu, Xianglin Yang, Haijun Liu +4Automated Software TestingLanguage Model Safety Evaluation

  2. Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection

    May 24, 2026Lixing Lin, Juli You, Yue Li +4Language Model Safety EvaluationLLM Guardrails

  3. How Well Do Models Follow Their Constitutions?

    May 22, 2026Arya Jakkli, Senthooran Rajamanoharan, Neel NandaLLM EvaluationLanguage Model Safety Evaluation

  4. Decomposing and Measuring Evaluation Awareness

    May 21, 2026Changling Li, Terry Jingchen Zhang, Jie Zhang +4LLM EvaluationLanguage Model Safety Evaluation

  5. Test-Time Training Undermines Safety Guardrails

    May 21, 2026Simone Antonelli, Sadegh Akhondzadeh, Aleksandar BojchevskiLanguage Model Safety EvaluationAdversarial Attacks on LLMs

  6. Can AI Make Conflicts Worse? An Alignment Failure in LLM Deployment Across Conflict Contexts

    May 21, 2026Andrii KryshtalLLM AlignmentLanguage Model Safety Evaluation

  7. Harder to Defend: Towards Chinese Toxicity Attacks via Implicit Enhancement and Obfuscation Rewriting

    May 21, 2026Jingyi Kang, Junyu Lu, Bo Xu +4Language Model Safety EvaluationToxicity Detection

  8. Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs

    May 20, 2026Dylan Feng, Pragya Srivastava, Anca Dragan +1Language Model Safety EvaluationLLM Guardrails

  9. RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts

    May 20, 2026Lukas Weidener, Marko Brkić, Mihailo Jovanović +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  10. Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models

    May 20, 2026Sunday Oyinlola Ogundoyin, Muhammad Ikram, Rahat MasoodLanguage Model Safety EvaluationHealthcare

  11. DECOR: Auditing LLM Deception via Information Manipulation Theory

    May 19, 2026Linyue Cai, Samuel Yeh, Jwala Dhamala +2Language Model Safety EvaluationLLM Auditing

  12. Monitoring the Internal Monologue: Probe Trajectories Reveal Reasoning Dynamics

    May 18, 2026Maciej Chrabąszcz, Aleksander Szymczyk, Marcin Sendera +2Language Model Safety EvaluationLLM Interpretability

  13. Multilingual jailbreaking of LLMs using low-resource languages

    May 18, 2026Dylan Marx, Marcel DunaiskiLanguage Model Safety EvaluationLLM Jailbreak Attacks

  14. Geometry-Lite: Interpretable Safety Probing via Layer-Wise Margin Geometry

    May 18, 2026Woo Seob Sim, Yu Rang ParkLanguage Model Safety EvaluationLLM Safety

  15. New Wide-Net-Casting Jailbreak Attacks Risk Large Models

    May 16, 2026Qiuchi Xiang, Haoxuan Qu, Hossein Rahmani +1Language Model Safety EvaluationJailbreak Attacks

  16. Training ML Models with Predictable Failures

    May 14, 2026Will Schwarzer, Scott NiekumLanguage Model Safety EvaluationLLM Fine-Tuning

  17. A Few Steps Further: Why Defenses Against Malicious Finetuning Erode Under Continued Training

    May 14, 2026Itay Zloczower, Eyal Lenga, Gilad Gressel +1Language Model Safety EvaluationAdversarial Attacks on LLMs

  18. NodeSynth: Socially Aligned Synthetic Data for AI Evaluation

    May 14, 2026Qazi Mamunur Rashid, Xuan Yang, Zhengzhe Yang +5Language Model Generation EvaluationLanguage Model Safety Evaluation

  19. AERIC: Anticipatory Hidden-State Monitoring for Implicit Harmful Dialogue

    May 13, 2026Jihyung Park, Saleh Afroogh, Junfeng JiaoLanguage Model Safety EvaluationLLM Guardrails