LLM Safety Evaluation

LLM: Large Language Model

Momentum

16 papers in the last four weeks, level with the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 177

All topics
CardsList
  1. Muse Spark Safety & Preparedness Report

    May 14, 2026Cristina Menghini, Peter Ney, Hamza Kwisaba +117CybersecurityAI Safety Evaluation

  2. Sycophancy is an Educational Safety Risk: Why LLM Tutors Need Sycophancy Benchmarks

    May 14, 2026Enkelejda Kasneci, Gjergji KasneciLLM SycophancyIntelligent Tutoring Systems

  3. The Great Pretender: A Stochasticity Problem in LLM Jailbreak

    May 14, 2026Jean-Philippe Monteuuis, Cong Chen, Jonathan PetitLLM Safety BenchmarksLLM Evaluation

  4. LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs

    May 13, 2026Rodrigo Nogueira, Thales Sales Almeida, Giovana Kerche Bonás +7Adversarial Prompt GenerationLLM Guardrails

  5. VERA-MH: Validation of Ethical and Responsible AI in Mental Health

    May 13, 2026Luca Belli, Kate H. Bentley, Josh Gieringer +6HealthcareMental Health

  6. Confidently Deceptive: On the Relationship Between Confidence and Deception in LLMs

    May 12, 2026Ali Asad, Stephen Obadinma, Anshul Pattoo +2Language Model Safety EvaluationConfidence Estimation in Language Models

  7. IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs

    May 11, 2026Songlin Bai, Xintong Wang, Linlin Yu +12LLM EvaluationQuestion Answering

  8. Benchmarking Safety Risks of Knowledge-Intensive Reasoning under Malicious Knowledge Editing

    May 11, 2026Qinghua Mao, Xi Lin, Jinze Gu +3Knowledge EditingKnowledge Conflicts in Language Models

  9. FragBench: Cross-Session Attacks Hidden in Benign-Looking Fragments

    May 10, 2026Astha Mehta, Niruthiha Selvanayagam, Cedric Lam +10LLM Safety BenchmarksLanguage Model Safety Evaluation

  10. GLiGuard: Schema-Conditioned Classification for LLM Safeguard

    May 8, 2026Urchade Zaratiana, Mary Newhauser, George Hurn-Maloney +1LLM GuardrailsText Classification

  11. Beyond Accuracy: Policy Invariance as a Reliability Test for LLM Safety Judges

    May 7, 2026Shihao Weng, Yang Feng, Xiaofei XieLLM-as-a-JudgeAI Agent Safety

  12. Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering

    May 7, 2026Xiaomin Li, Jianheng Hou, Zheyuan Deng +6LLM SafetyLLM Safety Evaluation

  13. Ask Before You Diagnose: Safe-Psych, a Sequential Evaluation Benchmark for LLMs in Psychiatry

    May 6, 2026Oriana Presacan, Andreea Grama, Larisa Irimină +6Selective PredictionHealthcare

  14. Safety and accuracy follow different scaling laws in clinical large language models

    May 5, 2026Sebastian Wind, Tri-Thien Nguyen, Jeta Sopa +9LLM Safety BenchmarksRetrieval-Augmented Generation

  15. Code World Model Preparedness Report

    May 1, 2026Daniel Song, Peter Ney, Cristina Menghini +21AI Safety EvaluationLLM Safety Evaluation

  16. ARMOR 2025: A Military-Aligned Benchmark for Evaluating Large Language Model Safety Beyond Civilian Contexts

    Apr 30, 2026Sydney Johns, Heng Jin, Chaoyu Zhang +2LLM Safety BenchmarksLLM Safety Alignment

  17. Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations

    Apr 29, 2026Mingqian Zheng, Malia Morgan, Liwei Jiang +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  18. Benchmarking the Safety of Large Language Models for Robotic Health Attendant Control

    Apr 29, 2026Mahiro Nakao, Kazuhiro TakemotoLanguage Model-Based ControlHealthcare

  19. Tatemae: Detecting Alignment Faking via Tool Selection in LLMs

    Apr 29, 2026Matteo Leonesi, Francesco Belardinelli, Flavio Corradini +1Deception in Language ModelsLLM Safety Alignment

  20. Grammar-Constrained Refinement of Safety Operational Rules Using Language in the Loop: What Could Go Wrong

    Apr 26, 2026Khouloud Gaaloul, Zaid Ghazal, Madhu Latha Pulimi +1Cyber-Physical SystemsSafety-Critical Control

  21. AI Safety Training Can be Clinically Harmful

    Apr 25, 2026Suhas BN, Andrew M. Sherrill, Rosa I. Arriaga +2Mental Health CounselingLLM Alignment

  22. Evaluating Jailbreaking Vulnerabilities in LLMs Deployed as Assistants for Smart Grid Operations: A Benchmark Against NERC Standards

    Apr 25, 2026Taha Hammadia, Lucas Rea, Ahmad Mohammad Saber +2LLM Jailbreak AttacksLLM Safety Evaluation

  23. SHAPE: Unifying Safety, Helpfulness and Pedagogy for Educational LLMs

    Apr 24, 2026Sihang Zhao, Kangrui Yu, Youliang Yuan +2Intelligent Tutoring SystemsGenerative AI in Education

  24. Omission Constraints Decay While Commission Constraints Persist in Long-Context LLM Agents

    Apr 22, 2026Yeran GamageAI Agent MonitoringLLM Security

  25. When Safety Fails Before the Answer: Benchmarking Harmful Behavior Detection in Reasoning Chains

    Apr 21, 2026Ishita Kakkar, Enze Zhang, Rheeya Uppaal +1AI Safety EvaluationLLM Safety Evaluation

  26. Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety

    Apr 20, 2026Marcello Galisai, Susanna Cifani, Francesco Giarrusso +5LLM Safety BenchmarksAdversarial Attacks on LLMs

  27. Using large language models for embodied planning introduces systematic safety risks

    Apr 20, 2026Tao Zhang, Kaixian Qu, Zhibin Li +4Large Language Model-Based Robot PlanningRobot Safety

  28. MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models

    Apr 20, 2026Suhyun Lee, Palakorn Achananuparp, Neemesh Yadav +2Mental Health CounselingLLM Evaluation

  29. On Safety Risks in Experience-Driven Self-Evolving Agents

    Apr 18, 2026Weixiang Zhao, Yichen Zhang, Yingshuo Wang +8LLM Safety EvaluationOver-Refusal

  30. When Choices Become Risks: Safety Failures of Large Language Models under Multiple-Choice Constraints

    Apr 18, 2026Yuheng Chen, Zhiyu Wu, Bowen Cheng +2Adversarial Attacks on LLMsLLM Safety Alignment

  31. A Systematic Study of Training-Free Methods for Trustworthy Large Language Models

    Apr 17, 2026Wai Man Si, Mingjie Li, Michael Backes +1LLM AlignmentLLM Safety

  32. Safety Training Modulates Harmful Misalignment Under On-Policy RL, But Direction Depends on Environment Design

    Apr 14, 2026Leon Eshuijs, Shihan Wang, Antske FokkensReward HackingRL for Language Models

  33. Peer-Preservation in Frontier Models

    Mar 30, 2026Yujin Potter, Nicholas Crispino, Vincent Siu +2AI Agent SafetyLLM Safety Evaluation

  34. SafeMath: Safe Solutions for Unsafe Math Word Problems

    Mar 26, 2026Sagnik Basu, Subhrajit Mitra, Aman Juneja +3LLM Safety AlignmentLLM Safety Evaluation

  35. SafeTutors: Benchmarking Pedagogical Safety in AI Tutoring Systems

    Mar 18, 2026Rima Hazra, Bikram Ghuku, Ilona Marchenko +5Intelligent Tutoring SystemsAI Safety Evaluation

  36. Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services

    Mar 11, 2026Fabrizio Dimino, Bhaskarjit Sarmah, Stefano PasqualiLanguage Model Safety EvaluationLLM Safety

  37. Safety boundary maintenance in consumer AI systems responding to pediatric health queries: a cross-platform benchmark evaluation under naturalistic and adversarially pressured conditions

    Dec 26, 2025Vahideh Zolfaghari, Leila Mashhadi, Mitra Ahadi +2HealthcareLLM Safety

  38. Context-Aware Classification and Grading of Sensitive Information in Online Conversational Health Data

    Dec 25, 2025Yiwei Yan, Guanfeng LiuHealthcareText Classification

  39. Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models

    Dec 21, 2025Zhang Wei, Hanxuan Chen, Peilu Hu +19Adversarial Robustness of Language ModelsLLM Safety Evaluation

  40. SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses

    Oct 17, 2025Hanbin Hong, Shuang Wu, Shuya Feng +6LLM SecurityLLM Jailbreak Attacks

  41. SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking

    Aug 21, 2025Xiangyang Zhu, Yuan Tian, Chunyi Li +3LLM Safety BenchmarksSynthetic Benchmark Generation

  42. HarmReduction: Benchmarking LLMs in Harm Reduction Information Provision to Support People Who Use Drugs

    Jul 29, 2025Kaixuan Wang, Chenxin Diao, Jason T. Jacques +2HealthcareQuestion Answering

  43. GuidedBench: Measuring and Mitigating the Evaluation Discrepancies of In-the-wild LLM Jailbreak Methods

    Feb 24, 2025Ruixuan Huang, Xunguang Wang, Zongjie Li +2Language Model Safety EvaluationLLM Jailbreak Attacks

  44. CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models

    Jan 24, 2025Guangzhi Sun, Xiao Zhan, Shutong Feng +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  45. Who Judges the Judges? A Chinese Safety QA Benchmark for Evaluating LLM Responses and Safety Judges

    Date pendingRui Yang, Shuang Huang, Junhua Liu +7LLM Safety BenchmarksLLM-as-a-Judge