Language Model Safety Evaluation

Latest papers 347

All topics
CardsList
  1. AVISE: Framework for Evaluating the Security of AI Systems

    Apr 22, 2026Mikko Lempinen, Joni Kemppainen, Niklas RaesalmiLanguage Model Safety EvaluationAdversarial Attacks on LLMs

  2. Breaking Bad: Interpretability-Based Safety Audits of State-of-the-Art LLMs

    Apr 22, 2026Krishiv Agarwal, Ramneet Kaur, Colin Samplawski +6Language Model Safety EvaluationLLM Auditing

  3. An Empirical Study of Multi-Generation Sampling for Jailbreak Detection in Large Language Models

    Apr 20, 2026Hanrui Luo, Shreyank N GowdaLanguage Model Safety EvaluationLLM Auditing

  4. LLM Safety From Within: Detecting Harmful Content with Internal Representations

    Apr 20, 2026Difan Jiao, Yilun Liu, Ye Yuan +4Language Model Safety EvaluationLLM Guardrails

  5. Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks

    Apr 20, 2026Md Rysul Kabir, Zoran TiganjLanguage Model Safety EvaluationLLM Interpretability

  6. Reverse Constitutional AI: A Framework for Controllable Toxic Data Generation via Probability-Clamped RLAIF

    Apr 20, 2026Yuan Fang, Yiming Luo, Aimin Zhou +1Language Model Safety EvaluationAdversarial Scenario Generation

  7. Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding

    Apr 18, 2026Yupeng Qi, Ziyu Lyu, Lixin Cui +2Language Model Safety EvaluationLLM Refusal Behavior

  8. Do LLMs Hold Their Values? MANTA: A Multi-Turn Adversarial Benchmark for Animal Welfare Reasoning

    Apr 18, 2026Isabella Luong, Joyee Chen, Arturs Kanepajs +5LLM EvaluationMoral Reasoning in Language Models

  9. Jailbreaking Large Language Models with Morality Attacks

    Apr 18, 2026Ying Su, Mingen Zheng, Weili Diao +1Moral Reasoning in Language ModelsLanguage Model Safety Evaluation

  10. Evaluating Multimodal LLMs for Inpatient Diagnosis: Real-World Performance, Safety, and Cost Across Ten Frontier Models

    Apr 18, 2026Bruce A. Bassett, Amy Rouillard, Sitwala Mundia +8Language Model Safety EvaluationHealthcare

  11. SafeDream: Safety World Model for Proactive Early Jailbreak Detection

    Apr 18, 2026Bo Yan, Weikai Lin, Yada Zhu +1Language Model Safety EvaluationWorld Models

  12. Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs

    Apr 17, 2026Jaechul Roh, Virat Shejwalkar, Amir HoumansadrLanguage Model Safety EvaluationLLM Fine-Tuning

  13. MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

    Apr 17, 2026Manh Luong, Tamas Abraham, Junae Kim +6LLM Safety BenchmarksLanguage Model Safety Evaluation

  14. TWGuard: A Case Study of LLM Safety Guardrails for Localized Linguistic Contexts

    Apr 17, 2026Hua-Rong Chu, Kuan-Chun Wang, Yao-Te HuangLanguage Model Safety EvaluationLLM Guardrails

  15. Context Over Content: Exposing Evaluation Faking in Automated Judges

    Apr 16, 2026Manan Gupta, Inderjeet Nair, Lu Wang +1LLM-as-a-JudgeLanguage Model Safety Evaluation

  16. VoxSafeBench: Not Just What Is Said, but Who, How, and Where

    Apr 16, 2026Yuxiang Wang, Hongyu Liu, Yijiang Xu +9Language Model Safety EvaluationPrivacy Leakage in Language Models

  17. The Hidden Puppet Master: Predicting Human Belief Change in Manipulative LLM Dialogues

    Mar 21, 2026Jocelyn Shen, Amina Luvsanchultem, Jessica Kim +6Opinion DynamicsLanguage Model Safety Evaluation

  18. Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services

    Mar 11, 2026Fabrizio Dimino, Bhaskarjit Sarmah, Stefano PasqualiLanguage Model Safety EvaluationLLM Safety

  19. AdaCultureSafe: Adaptive Cultural Safety Grounded by Cultural Knowledge in Large Language Models

    Mar 9, 2026Hankun Kang, Di Lin, Zhirong Liao +6Language Model Safety EvaluationCultural Knowledge in Language Models

  20. CoT is Not the Chain of Truth: An Empirical Internal Analysis of Reasoning LLMs for Fake News Generation

    Feb 4, 2026Zhao Tong, Chunlin Gong, Yiping Zhang +5Language Model Safety EvaluationLLM Interpretability

  21. SalamahBench: Dialect and Category Level Safety Evaluation of Arabic Language Models

    Feb 3, 2026Omar Abdelnasser, Fatemah Alharbi, Khaled Khasawneh +2LLM Safety BenchmarksMultilingual Language Model Evaluation

  22. VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models

    Jan 27, 2026Yuxiang Wang, Hongyu Liu, Dekun Chen +2Privacy-Preserving Language ModelsLanguage Model Safety Evaluation