Language Model Safety Evaluation

Latest papers 396

All topics
CardsList
  1. Harder to Defend: Towards Chinese Toxicity Attacks via Implicit Enhancement and Obfuscation Rewriting

    May 21, 2026Jingyi Kang, Junyu Lu, Bo Xu +4Language Model Safety EvaluationToxicity Detection

  2. Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs

    May 20, 2026Dylan Feng, Pragya Srivastava, Anca Dragan +1Language Model Safety EvaluationLLM Guardrails

  3. RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts

    May 20, 2026Lukas Weidener, Marko Brkić, Mihailo Jovanović +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  4. Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models

    May 20, 2026Sunday Oyinlola Ogundoyin, Muhammad Ikram, Rahat MasoodLanguage Model Safety EvaluationHealthcare

  5. DECOR: Auditing LLM Deception via Information Manipulation Theory

    May 19, 2026Linyue Cai, Samuel Yeh, Jwala Dhamala +2Language Model Safety EvaluationLLM Auditing

  6. Monitoring the Internal Monologue: Probe Trajectories Reveal Reasoning Dynamics

    May 18, 2026Maciej Chrabąszcz, Aleksander Szymczyk, Marcin Sendera +2Language Model Safety EvaluationLLM Interpretability

  7. Multilingual jailbreaking of LLMs using low-resource languages

    May 18, 2026Dylan Marx, Marcel DunaiskiLanguage Model Safety EvaluationLLM Jailbreak Attacks

  8. Geometry-Lite: Interpretable Safety Probing via Layer-Wise Margin Geometry

    May 18, 2026Woo Seob Sim, Yu Rang ParkLanguage Model Safety EvaluationLLM Safety

  9. New Wide-Net-Casting Jailbreak Attacks Risk Large Models

    May 16, 2026Qiuchi Xiang, Haoxuan Qu, Hossein Rahmani +1Language Model Safety EvaluationJailbreak Attacks

  10. Training ML Models with Predictable Failures

    May 14, 2026Will Schwarzer, Scott NiekumLanguage Model Safety EvaluationLLM Fine-Tuning

  11. A Few Steps Further: Why Defenses Against Malicious Finetuning Erode Under Continued Training

    May 14, 2026Itay Zloczower, Eyal Lenga, Gilad Gressel +1Language Model Safety EvaluationAdversarial Attacks on LLMs

  12. NodeSynth: Socially Aligned Synthetic Data for AI Evaluation

    May 14, 2026Qazi Mamunur Rashid, Xuan Yang, Zhengzhe Yang +5Language Model Generation EvaluationLanguage Model Safety Evaluation

  13. AERIC: Anticipatory Hidden-State Monitoring for Implicit Harmful Dialogue

    May 13, 2026Jihyung Park, Saleh Afroogh, Junfeng JiaoLanguage Model Safety EvaluationLLM Guardrails

  14. Confidently Deceptive: On the Relationship Between Confidence and Deception in LLMs

    May 12, 2026Ali Asad, Stephen Obadinma, Anshul Pattoo +2Language Model Safety EvaluationConfidence Estimation in Language Models

  15. To Whom Do Language Models Align? Measuring Principal Hierarchies Under High-Stakes Competing Demands

    May 12, 2026Fangyi Yu, Nabeel Seedat, Jonathan Richard Schwarz +1LLM AlignmentLanguage Model Safety Evaluation

  16. Safety-Oriented Evaluation of Language Understanding Systems for Air Traffic Control

    May 12, 2026Yujing Chang, Yash Guleria, Duc-Thinh Pham +4LLM GroundingAir Traffic Management

  17. Beyond Red-Teaming: Formal Guarantees of LLM Guardrail Classifiers

    May 11, 2026Nikita Kezins, Urbas Ekka, Pascal Berrang +1Neural Network VerificationLanguage Model Safety Evaluation

  18. RUBEN: Rule-Based Explanations for Retrieval-Augmented LLM Systems

    May 11, 2026Joel Rorseth, Parke Godfrey, Lukasz Golab +2Retrieval-Augmented GenerationLanguage Model Safety Evaluation