Language Model Safety Evaluation

Latest papers 396

All topics
CardsList
  1. A Translational Note on AI Safety Evaluation

    Sep 6, 2026Madhava GaikwadLanguage Model Safety EvaluationAI Safety Evaluation

  2. SRD-GUARD: A Defense Framework of LLMs via Semantic Rewriting and Joint Multi-Model Scoring for Latent Intent Exposure

    Sep 6, 2026Qi Wang, Chengcheng Wan, Jiangtao WangLLM GuardrailsLLM Jailbreak Attacks

  3. Beyond the Flag: Clinical Framing Closes the Moderation Gap in Suicide Risk Measurement

    Sep 5, 2026Shreyas Krishnan, Gun Ahn, Jungjin KimSuicide Risk ModelingContent Moderation

  4. SAFEGuard: Detect Optimization-Based Jailbreak Attacks Through Harmful Semantic Analysis and Fluency Measurement

    Sep 5, 2026Quoc Viet Vo, Trung Le, Damith C. Ranasinghe +1LLM SecurityJailbreak Attacks

  5. SinoGlyphBench: A Diagnostic Benchmark for Chinese Glyph-Level Obfuscation in Language-Model Moderation

    Sep 5, 2026Yifan Wang, Zimu Wang, Suliu Qin +10Language Model Safety EvaluationContent Moderation

  6. Language models judge war differently when tested for alignment

    Sep 4, 2026Maxim ChupilkinEvaluation Awareness in Language ModelsLanguage Model Safety Evaluation

  7. Refuse without Refusal: A Structural Analysis of Safety-Tuning Responses for Reducing False Refusals in Language Models

    Sep 4, 2026Minji Kim, Hyounghun KimRefusal Behavior in Language ModelsFine-Tuning

  8. Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal

    Sep 3, 2026Alejo López-Ávila, Iker García-Ferrero, Jezabel Garcia +2LLM Safety AlignmentRefusal Behavior in Language Models

  9. Who Judges the Judges? A Chinese Safety QA Benchmark for Evaluating LLM Responses and Safety Judges

    Sep 1, 2026Rui Yang, Shuang Huang, Junhua Liu +7LLM Safety BenchmarksLLM-as-a-Judge

  10. Validity-Aware Jailbreak Evaluation for Large Language Models

    Aug 31, 2026Qilong Wu, Sahil Wadhwa, Pranab Mohanty +2Language Model Safety EvaluationLLM Auditing

  11. Beyond Token Positions: Safety Alignment Across Denoising Steps in Diffusion Language Models

    Aug 31, 2026Guoli Wang, Haonan Shi, Tu Ouyang +1Language Model Safety EvaluationDiffusion Language Model Decoding

  12. Capability-Gated Language Models: Security Composes, Utility Does Not

    Aug 31, 2026Patrikas Vanagas, Augustas Mačijauskas, Laurynas LopataLanguage Model Safety EvaluationLLM Security

  13. The Fragility of Jailbreak Robustness Across Operational States

    Aug 31, 2026Yuna Park, Hwang Youn Kim, Yujin Kim +3Prompt SensitivityLanguage Model Safety Evaluation

  14. SingProbe Technical Report

    Aug 31, 2026Sing TeamLanguage Model Safety EvaluationLLM Guardrails

  15. WildSEEK: Evaluating Language Models for Information-Seeking

    Aug 31, 2026Tanise Ceron, Joachim Baumann, Elisa Bassignana +3LLM Safety BenchmarksLLM Sycophancy

  16. Reference-Grafting Matches Fine-Tuning at Eliciting Sandbagged Capabilities

    Aug 29, 2026Linh Le, Hong Kiat Tan, David Williams-KingCausal Interventions in Language ModelsLanguage Model Safety Evaluation

  17. Not the Same Protector: Deployment-Dependent Protective Intervention in LLMs

    Aug 29, 2026Eunna Lee, Soomyoung Lee, Jungpyo Nam +6LLM SafetyLanguage Model Safety Evaluation

  18. REINS: Refusal-Enhanced Inhibitory Steering with Sparse Autoencoder Features

    Aug 28, 2026Kai-Xuan Ding, Hao-Xiang Xu, Ji-Hua Peng +3LLM SafetyRefusal Behavior in Language Models

  19. EvoHarmBench: Breaking Content Moderation with Iterative Human-Like Evasion

    Aug 28, 2026Ruijie Jian, Benlei Cui, Ting Ma +8Language Model Safety EvaluationLLM Safety Benchmarks

  20. LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails

    Aug 27, 2026Ziyang Chen, Xing Wu, Songlin HuLanguage Model Safety EvaluationLong-Context Language Model Evaluation

  21. NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation

    Aug 26, 2026Zhiyuan Xu, Muhammad Firhard Roslan, Joseph Gardiner +2Language Model Safety EvaluationLLM Security