Language Model Safety Evaluation

Latest papers 347

All topics
CardsList
  1. Unknown Unknowns: Do Hidden Intentions in LLMs Evade Detection?

    Jan 26, 2026Devansh Srivastav, David Pape, Lea SchönherrLanguage Model Safety EvaluationLLM Auditing

  2. SycoEval-EM: Sycophancy Evaluation of Large Language Models in Simulated Clinical Encounters for Emergency Care

    Jan 23, 2026Dongshen Peng, Yi Wang, Austin Schoeffler +5LLM SycophancyLanguage Model Safety Evaluation

  3. In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement

    Jan 19, 2026Anudeex Shetty, Aditya Joshi, Salil S. KanhereLanguage Model Safety EvaluationAdversarial Attacks on LLMs

  4. Preserving Fairness and Safety in Quantized LLMs Through Critical Weight Protection

    Jan 17, 2026Muhammad Alif Al Hakim, Alfan Farizki Wicaksono, Fajri KotoLLM QuantizationMultilingual Language Model Evaluation

  5. Towards Multi-modal Multi-turn Safety: From Agentic Interaction to Strategic Alignment

    Jan 8, 2026Han Zhu, Jiale Chen, Chengkun Cai +8Language Model Safety EvaluationMultimodal Large Language Models

  6. Safety Is Not Universal: The Selective Safety Trap in LLM Alignment

    Jan 7, 2026Iago Alves Brito, Walcy Santos Rezende Rios, Julia Soares Dollis +2LLM Safety BenchmarksLLM Alignment

  7. Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Retrieval, Reasoning, and Hallucination in Long-Context LLMs

    Jan 5, 2026Amirali Ebrahimzadeh, Seyyed M. SaliliLong-Context RetrievalLLM Hallucination Mitigation

  8. Training-Free Policy Violation Detection via Activation-Space Whitening in LLMs

    Dec 3, 2025Oren Rachmil, Avishag Shapira, Roy Betser +5Language Model Safety EvaluationLLM Auditing

  9. Addressing Benchmarking Gaps in Large Language Models for Health and Medicine with Dynamic Red-Teaming

    Jul 30, 2025Jiazhen Pan, Bailiang Jian, Paul Hager +20LLM Safety BenchmarksLanguage Model Safety Evaluation

  10. PRISON: Unmasking the Criminal Potential of Large Language Models

    Jun 19, 2025Xinyi Wu, Geng Hong, Pei Chen +3Language Model Safety EvaluationLLM Auditing

  11. When Do Large Language Models Exhibit Unsolicited Deception?

    Mar 31, 2025Samuel M. Taylor, Benjamin K. BergenLanguage Model Safety EvaluationDeception in Language Models

  12. GuidedBench: Measuring and Mitigating the Evaluation Discrepancies of In-the-wild LLM Jailbreak Methods

    Feb 24, 2025Ruixuan Huang, Xunguang Wang, Zongjie Li +2Language Model Safety EvaluationLLM Jailbreak Attacks

  13. CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models

    Jan 24, 2025Guangzhi Sun, Xiao Zhan, Shutong Feng +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  14. Who Judges the Judges? A Chinese Safety QA Benchmark for Evaluating LLM Responses and Safety Judges

    Date pendingRui Yang, Shuang Huang, Junhua Liu +7LLM Safety BenchmarksLLM-as-a-Judge