LLM Safety Evaluation

LLM: Large Language Model

Momentum

16 papers in the last four weeks, level with the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 177

All topics
CardsList
  1. Muse Spark Safety & Preparedness Report

    May 14, 2026Cristina Menghini, Peter Ney, Hamza Kwisaba +117CybersecurityAI Safety Evaluation

  2. Sycophancy is an Educational Safety Risk: Why LLM Tutors Need Sycophancy Benchmarks

    May 14, 2026Enkelejda Kasneci, Gjergji KasneciLLM SycophancyIntelligent Tutoring Systems

  3. The Great Pretender: A Stochasticity Problem in LLM Jailbreak

    May 14, 2026Jean-Philippe Monteuuis, Cong Chen, Jonathan PetitLLM Safety BenchmarksLLM Evaluation

  4. LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs

    May 13, 2026Rodrigo Nogueira, Thales Sales Almeida, Giovana Kerche Bonás +7Adversarial Prompt GenerationLLM Guardrails

  5. VERA-MH: Validation of Ethical and Responsible AI in Mental Health

    May 13, 2026Luca Belli, Kate H. Bentley, Josh Gieringer +6HealthcareMental Health

  6. Confidently Deceptive: On the Relationship Between Confidence and Deception in LLMs

    May 12, 2026Ali Asad, Stephen Obadinma, Anshul Pattoo +2Language Model Safety EvaluationConfidence Estimation in Language Models

  7. IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs

    May 11, 2026Songlin Bai, Xintong Wang, Linlin Yu +12LLM EvaluationQuestion Answering

  8. Benchmarking Safety Risks of Knowledge-Intensive Reasoning under Malicious Knowledge Editing

    May 11, 2026Qinghua Mao, Xi Lin, Jinze Gu +3Knowledge EditingKnowledge Conflicts in Language Models

  9. FragBench: Cross-Session Attacks Hidden in Benign-Looking Fragments

    May 10, 2026Astha Mehta, Niruthiha Selvanayagam, Cedric Lam +10LLM Safety BenchmarksLanguage Model Safety Evaluation

  10. GLiGuard: Schema-Conditioned Classification for LLM Safeguard

    May 8, 2026Urchade Zaratiana, Mary Newhauser, George Hurn-Maloney +1LLM GuardrailsText Classification

  11. Beyond Accuracy: Policy Invariance as a Reliability Test for LLM Safety Judges

    May 7, 2026Shihao Weng, Yang Feng, Xiaofei XieLLM-as-a-JudgeAI Agent Safety

  12. Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering

    May 7, 2026Xiaomin Li, Jianheng Hou, Zheyuan Deng +6LLM SafetyLLM Safety Evaluation

  13. Ask Before You Diagnose: Safe-Psych, a Sequential Evaluation Benchmark for LLMs in Psychiatry

    May 6, 2026Oriana Presacan, Andreea Grama, Larisa Irimină +6Selective PredictionHealthcare

  14. Safety and accuracy follow different scaling laws in clinical large language models

    May 5, 2026Sebastian Wind, Tri-Thien Nguyen, Jeta Sopa +9LLM Safety BenchmarksRetrieval-Augmented Generation

  15. Code World Model Preparedness Report

    May 1, 2026Daniel Song, Peter Ney, Cristina Menghini +21AI Safety EvaluationLLM Safety Evaluation

  16. ARMOR 2025: A Military-Aligned Benchmark for Evaluating Large Language Model Safety Beyond Civilian Contexts

    Apr 30, 2026Sydney Johns, Heng Jin, Chaoyu Zhang +2LLM Safety BenchmarksLLM Safety Alignment

  17. Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations

    Apr 29, 2026Mingqian Zheng, Malia Morgan, Liwei Jiang +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  18. Benchmarking the Safety of Large Language Models for Robotic Health Attendant Control

    Apr 29, 2026Mahiro Nakao, Kazuhiro TakemotoLanguage Model-Based ControlHealthcare

  19. Tatemae: Detecting Alignment Faking via Tool Selection in LLMs

    Apr 29, 2026Matteo Leonesi, Francesco Belardinelli, Flavio Corradini +1Deception in Language ModelsLLM Safety Alignment

  20. Grammar-Constrained Refinement of Safety Operational Rules Using Language in the Loop: What Could Go Wrong

    Apr 26, 2026Khouloud Gaaloul, Zaid Ghazal, Madhu Latha Pulimi +1Cyber-Physical SystemsSafety-Critical Control

  21. AI Safety Training Can be Clinically Harmful

    Apr 25, 2026Suhas BN, Andrew M. Sherrill, Rosa I. Arriaga +2Mental Health CounselingLLM Alignment

  22. Evaluating Jailbreaking Vulnerabilities in LLMs Deployed as Assistants for Smart Grid Operations: A Benchmark Against NERC Standards

    Apr 25, 2026Taha Hammadia, Lucas Rea, Ahmad Mohammad Saber +2LLM Jailbreak AttacksLLM Safety Evaluation

  23. SHAPE: Unifying Safety, Helpfulness and Pedagogy for Educational LLMs

    Apr 24, 2026Sihang Zhao, Kangrui Yu, Youliang Yuan +2Intelligent Tutoring SystemsGenerative AI in Education

  24. Omission Constraints Decay While Commission Constraints Persist in Long-Context LLM Agents

    Apr 22, 2026Yeran GamageAI Agent MonitoringLLM Security