Language Model Safety Evaluation

Latest papers 396

All topics
CardsList
  1. Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding

    Apr 18, 2026Yupeng Qi, Ziyu Lyu, Lixin Cui +2Language Model Safety EvaluationLLM Refusal Behavior

  2. Do LLMs Hold Their Values? MANTA: A Multi-Turn Adversarial Benchmark for Animal Welfare Reasoning

    Apr 18, 2026Isabella Luong, Joyee Chen, Arturs Kanepajs +5LLM EvaluationMoral Reasoning in Language Models

  3. Jailbreaking Large Language Models with Morality Attacks

    Apr 18, 2026Ying Su, Mingen Zheng, Weili Diao +1Moral Reasoning in Language ModelsLanguage Model Safety Evaluation

  4. Evaluating Multimodal LLMs for Inpatient Diagnosis: Real-World Performance, Safety, and Cost Across Ten Frontier Models

    Apr 18, 2026Bruce A. Bassett, Amy Rouillard, Sitwala Mundia +8Language Model Safety EvaluationHealthcare

  5. SafeDream: Safety World Model for Proactive Early Jailbreak Detection

    Apr 18, 2026Bo Yan, Weikai Lin, Yada Zhu +1Language Model Safety EvaluationWorld Models

  6. Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs

    Apr 17, 2026Jaechul Roh, Virat Shejwalkar, Amir HoumansadrLanguage Model Safety EvaluationLLM Fine-Tuning

  7. MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

    Apr 17, 2026Manh Luong, Tamas Abraham, Junae Kim +6LLM Safety BenchmarksLanguage Model Safety Evaluation

  8. TWGuard: A Case Study of LLM Safety Guardrails for Localized Linguistic Contexts

    Apr 17, 2026Hua-Rong Chu, Kuan-Chun Wang, Yao-Te HuangLanguage Model Safety EvaluationLLM Guardrails

  9. Context Over Content: Exposing Evaluation Faking in Automated Judges

    Apr 16, 2026Manan Gupta, Inderjeet Nair, Lu Wang +1LLM-as-a-JudgeLanguage Model Safety Evaluation

  10. VoxSafeBench: Not Just What Is Said, but Who, How, and Where

    Apr 16, 2026Yuxiang Wang, Hongyu Liu, Yijiang Xu +9Language Model Safety EvaluationPrivacy Leakage in Language Models

  11. The Hidden Puppet Master: Predicting Human Belief Change in Manipulative LLM Dialogues

    Mar 21, 2026Jocelyn Shen, Amina Luvsanchultem, Jessica Kim +6Opinion DynamicsLanguage Model Safety Evaluation

  12. Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services

    Mar 11, 2026Fabrizio Dimino, Bhaskarjit Sarmah, Stefano PasqualiLanguage Model Safety EvaluationLLM Safety

  13. AdaCultureSafe: Adaptive Cultural Safety Grounded by Cultural Knowledge in Large Language Models

    Mar 9, 2026Hankun Kang, Di Lin, Zhirong Liao +6Language Model Safety EvaluationCultural Knowledge in Language Models

  14. CoT is Not the Chain of Truth: An Empirical Internal Analysis of Reasoning LLMs for Fake News Generation

    Feb 4, 2026Zhao Tong, Chunlin Gong, Yiping Zhang +5Language Model Safety EvaluationLLM Interpretability

  15. SalamahBench: Dialect and Category Level Safety Evaluation of Arabic Language Models

    Feb 3, 2026Omar Abdelnasser, Fatemah Alharbi, Khaled Khasawneh +2LLM Safety BenchmarksMultilingual Language Model Evaluation

  16. VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models

    Jan 27, 2026Yuxiang Wang, Hongyu Liu, Dekun Chen +2Privacy-Preserving Language ModelsLanguage Model Safety Evaluation

  17. Unknown Unknowns: Do Hidden Intentions in LLMs Evade Detection?

    Jan 26, 2026Devansh Srivastav, David Pape, Lea SchönherrLanguage Model Safety EvaluationLLM Auditing

  18. SycoEval-EM: Sycophancy Evaluation of Large Language Models in Simulated Clinical Encounters for Emergency Care

    Jan 23, 2026Dongshen Peng, Yi Wang, Austin Schoeffler +5LLM SycophancyLanguage Model Safety Evaluation

  19. In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement

    Jan 19, 2026Anudeex Shetty, Aditya Joshi, Salil S. KanhereLanguage Model Safety EvaluationAdversarial Attacks on LLMs

  20. Preserving Fairness and Safety in Quantized LLMs Through Critical Weight Protection

    Jan 17, 2026Muhammad Alif Al Hakim, Alfan Farizki Wicaksono, Fajri KotoLLM QuantizationMultilingual Language Model Evaluation

  21. Towards Multi-modal Multi-turn Safety: From Agentic Interaction to Strategic Alignment

    Jan 8, 2026Han Zhu, Jiale Chen, Chengkun Cai +8Language Model Safety EvaluationMultimodal Large Language Models

  22. Safety Is Not Universal: The Selective Safety Trap in LLM Alignment

    Jan 7, 2026Iago Alves Brito, Walcy Santos Rezende Rios, Julia Soares Dollis +2LLM Safety BenchmarksLLM Alignment

  23. Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Retrieval, Reasoning, and Hallucination in Long-Context LLMs

    Jan 5, 2026Amirali Ebrahimzadeh, Seyyed M. SaliliLong-Context RetrievalLLM Hallucination Mitigation

  24. Training-Free Policy Violation Detection via Activation-Space Whitening in LLMs

    Dec 3, 2025Oren Rachmil, Avishag Shapira, Roy Betser +5Language Model Safety EvaluationLLM Auditing