LLM Safety Evaluation

LLM: Large Language Model

Momentum

16 papers in the last four weeks, level with the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 177

All topics
CardsList
  1. When Safety Fails Before the Answer: Benchmarking Harmful Behavior Detection in Reasoning Chains

    Apr 21, 2026Ishita Kakkar, Enze Zhang, Rheeya Uppaal +1AI Safety EvaluationLLM Safety Evaluation

  2. Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety

    Apr 20, 2026Marcello Galisai, Susanna Cifani, Francesco Giarrusso +5LLM Safety BenchmarksAdversarial Attacks on LLMs

  3. Using large language models for embodied planning introduces systematic safety risks

    Apr 20, 2026Tao Zhang, Kaixian Qu, Zhibin Li +4Large Language Model-Based Robot PlanningRobot Safety

  4. MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models

    Apr 20, 2026Suhyun Lee, Palakorn Achananuparp, Neemesh Yadav +2Mental Health CounselingLLM Evaluation

  5. On Safety Risks in Experience-Driven Self-Evolving Agents

    Apr 18, 2026Weixiang Zhao, Yichen Zhang, Yingshuo Wang +8LLM Safety EvaluationOver-Refusal

  6. When Choices Become Risks: Safety Failures of Large Language Models under Multiple-Choice Constraints

    Apr 18, 2026Yuheng Chen, Zhiyu Wu, Bowen Cheng +2Adversarial Attacks on LLMsLLM Safety Alignment

  7. A Systematic Study of Training-Free Methods for Trustworthy Large Language Models

    Apr 17, 2026Wai Man Si, Mingjie Li, Michael Backes +1LLM AlignmentLLM Safety

  8. Safety Training Modulates Harmful Misalignment Under On-Policy RL, But Direction Depends on Environment Design

    Apr 14, 2026Leon Eshuijs, Shihan Wang, Antske FokkensReward HackingRL for Language Models

  9. Peer-Preservation in Frontier Models

    Mar 30, 2026Yujin Potter, Nicholas Crispino, Vincent Siu +2AI Agent SafetyLLM Safety Evaluation

  10. SafeMath: Safe Solutions for Unsafe Math Word Problems

    Mar 26, 2026Sagnik Basu, Subhrajit Mitra, Aman Juneja +3LLM Safety AlignmentLLM Safety Evaluation

  11. SafeTutors: Benchmarking Pedagogical Safety in AI Tutoring Systems

    Mar 18, 2026Rima Hazra, Bikram Ghuku, Ilona Marchenko +5Intelligent Tutoring SystemsAI Safety Evaluation

  12. Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services

    Mar 11, 2026Fabrizio Dimino, Bhaskarjit Sarmah, Stefano PasqualiLanguage Model Safety EvaluationLLM Safety

  13. Safety boundary maintenance in consumer AI systems responding to pediatric health queries: a cross-platform benchmark evaluation under naturalistic and adversarially pressured conditions

    Dec 26, 2025Vahideh Zolfaghari, Leila Mashhadi, Mitra Ahadi +2HealthcareLLM Safety

  14. Context-Aware Classification and Grading of Sensitive Information in Online Conversational Health Data

    Dec 25, 2025Yiwei Yan, Guanfeng LiuHealthcareText Classification

  15. Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models

    Dec 21, 2025Zhang Wei, Hanxuan Chen, Peilu Hu +19Adversarial Robustness of Language ModelsLLM Safety Evaluation

  16. SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses

    Oct 17, 2025Hanbin Hong, Shuang Wu, Shuya Feng +6LLM SecurityLLM Jailbreak Attacks

  17. SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking

    Aug 21, 2025Xiangyang Zhu, Yuan Tian, Chunyi Li +3LLM Safety BenchmarksSynthetic Benchmark Generation

  18. HarmReduction: Benchmarking LLMs in Harm Reduction Information Provision to Support People Who Use Drugs

    Jul 29, 2025Kaixuan Wang, Chenxin Diao, Jason T. Jacques +2HealthcareQuestion Answering

  19. GuidedBench: Measuring and Mitigating the Evaluation Discrepancies of In-the-wild LLM Jailbreak Methods

    Feb 24, 2025Ruixuan Huang, Xunguang Wang, Zongjie Li +2Language Model Safety EvaluationLLM Jailbreak Attacks

  20. CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models

    Jan 24, 2025Guangzhi Sun, Xiao Zhan, Shutong Feng +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  21. Who Judges the Judges? A Chinese Safety QA Benchmark for Evaluating LLM Responses and Safety Judges

    Date pendingRui Yang, Shuang Huang, Junhua Liu +7LLM Safety BenchmarksLLM-as-a-Judge