LLM Safety Evaluation

LLM: Large Language Model

Momentum

16 papers in the last four weeks, level with the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 177

All topics
CardsList
  1. Safe Alone, Unsafe Together: Safeguarding Against Implicit Toxicity When Benign Images Combine

    Jul 1, 2026Jiaxian Lv, Shiyao Cui, Yingkang Wang +3Toxicity DetectionSafety Filtering

  2. EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures

    Jun 29, 2026Buğra Alperen Uluırmak, Rifat KurbanAI AlignmentLLM Safety Alignment

  3. SCARCE: Scalable Cascade Analysis for Rare-event Characterisation via Embeddings

    Jun 28, 2026Yingjie Wang, Yi Dong, Edmund Lau +3LLM Safety EvaluationRare-Event Estimation

  4. Paved with True Intents: Intent-Aware Training Improves LLM Safety Classification Across Training Regimes

    Jun 25, 2026Jeremias Ferrao, Niclas Müller-Hof, Iustin Sîrbu +2LLM Safety EvaluationLLM Post-Training

  5. RAS: Measuring LLM Safety Through Refusal Alignment

    Jun 24, 2026Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu +1LLM Safety AlignmentLLM Safety

  6. A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

    Jun 24, 2026Abrar Alotaibi, Raed Mughus, Moataz AhmedMultilingual Language Model EvaluationLLM Evaluation

  7. Do Thinking Tokens Help with Safety?

    Jun 23, 2026Narutatsu Ri, Abhishek Panigrahi, Sanjeev AroraLLM Refusal BehaviorLLM Safety Evaluation

  8. Distributed Quality-Diversity Search for Toxicity in Large Language Models

    Jun 23, 2026Onkar Shelar, Travis DesellAdversarial Prompt GenerationLLM Red Teaming

  9. FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming

    Jun 18, 2026Chaeyun Kim, Daeyoung Park, Junghwan Kim +4LLM Safety BenchmarksFinancial Services

  10. Analyzing the Narration Gap in LLM-Solver Loops

    Jun 17, 2026Zunchen Huang, Songgaojun DengAdversarial Attacks on LLMsFormal Verification

  11. SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety

    Jun 17, 2026Linghao Feng, Yinqian Sun, Dongqi Liang +8LLM Safety BenchmarksAI for Science

  12. Automated jailbreak attack targeting multiple defense strategies

    Jun 15, 2026Qi Wang, Chengcheng Wan, Weijia He +4Adversarial Prompt GenerationLLM Jailbreak Attacks

  13. Risk-Aware LLM Agents for Geospatial Data Retrieval: Design and Preliminary Adversarial Evaluation

    Jun 13, 2026Kyle Gao, Joel Cumming, Jonathan Li +2Multi-Agent LLM SystemsLLM Tool Use

  14. BELLS-O: Evaluating the Operational Trade-offs of LLM Supervision Systems

    Jun 12, 2026Leonhard Waibl, Felix Michalak, Hadrien MariacciaLLM Safety BenchmarksLLM Guardrails

  15. Risk Under Pressure: Compute-Aware Evaluation of Adversarial Robustness in Language Models

    Jun 9, 2026Malikeh Ehghaghi, Boglárka Ecsedi, Marsha Chechik +1LLM AlignmentNeural Network Robustness

  16. Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges

    Jun 8, 2026Yongtaek Lim, Hyeji Choi, Minwoo KimLLM-as-a-JudgeLLM Safety Evaluation

  17. Personalization Meets Safety:Mechanisms,Risks,and Mitigations in Personalized LLMs

    Jun 8, 2026Yanyan Luo, Xue Han, Ruiqiao Bai +10LLM PersonalizationLLM Safety

  18. SafeRun: Enabling Determinism in LLM Planning for Running

    Jun 8, 2026Meilin Chen, Zepeng Zhai, Jiaxuan Zhao +1LLM PlanningLLM Safety Evaluation

  19. Sycophancy Towards Researchers Drives Performative Misalignment

    Jun 7, 2026David D. Baek, Xinnuo Li, Anay Gupta +4LLM SycophancyLLM Alignment

  20. Building Comparative Motivation Profiles with Instrumental Interventions

    Jun 6, 2026David Vella Zarb, Rustem Turtayev, Taywon Min +2LLM Safety EvaluationCausal Interventions in Language Models

  21. SciTrace: Trajectory-Aware Safety Reasoning for Scientific Discovery Agents

    Jun 6, 2026Tanush Swaminathan, Runmin Jiang, Letian Zhang +1AI Agents for Scientific DiscoveryLLM Safety Evaluation

  22. The Governance of Human-LLM Interaction: Safety Gating, Civility Steering, and Affective Default Lock-In

    Jun 6, 2026Manuele Reani, Hongjian Zhang, Hongyu TianLanguage Model SteeringLLM Safety Evaluation

  23. Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators

    Jun 5, 2026Anissa Alloula, Federico Licini, Ava Batchkala +1LLM-as-a-JudgeIn-Context Learning

  24. AICompanionBench: Benchmarking LLMs-as-Judges for AI Companion Safety

    Jun 3, 2026Yanjing Ren, Reza Ebrahimi, TengTeng MaLLM Safety BenchmarksLLM-as-a-Judge

  25. PreAct-Bench: Benchmarking Predictive Monitoring in LLMs

    Jun 3, 2026Hainiu Xu, Italo Luis da Silva, Jiangnan Ye +7LLM Safety BenchmarksMoral Reasoning in Language Models

  26. Black-box, Adaptive, Efficient, Transferable, Harmful, Applicable... Attacks Are All You Need to Break LLMs

    Jun 2, 2026Vincent Limbach, Jonas Dornbusch, David Lüdke +2LLM Jailbreak AttacksLLM Safety Evaluation

  27. DDOR: Delta Debugging for Explainable Overrefusal Testing and Repair

    Jun 2, 2026Qinyan Zhou, Peixin Zhang, Jun Sun +2LLM GuardrailsLLM Refusal Behavior

  28. Food Noise & False Safety: A Systematic Evaluation of How LLMs Fail to Adapt to Eating Disorder Queries with Clinician Feedback

    Jun 1, 2026Giulia Pucci, Emily Hemendinger, Ruizhe Li +3Mental HealthLLM Safety

  29. Lost in Delusion: Examining LLM Safety Under User Delusions and Distress

    May 31, 2026Andrew Aquilina, Chetna Nihalani, Vasudha Varadarajan +3Mental HealthLLM Safety Alignment

  30. TRACE: Trajectory Risk-Aware Compression for Long-Horizon Agent Safety

    May 30, 2026Zhepei Hong, Lin Wang, Liting Li +5AI Agent SafetyLLM Safety Evaluation

  31. Position: Anthropomorphic Misalignment Research Needs Stronger Evidence

    May 29, 2026Vansh Gupta, Peter Nutter, Samuel Stante +5LLM Safety Evaluation

  32. Triaging Threats to Specialized Guardrails

    May 29, 2026Wenjie Jacky Mo, Xiaofei Wen, Rui Cai +6LLM Safety BenchmarksLLM Guardrails

  33. Inform, Coach, Relate, Listen: Auditing LLM Caregiving Support Roles

    May 28, 2026Drishti Goel, Agam Goyal, Veda Duddu +8HealthcareLLM Auditing

  34. SciIntBench: Measuring LLM Compliance with Research Integrity Norms Under Adversarial Framing

    May 28, 2026Almene De Meran Meguimtsop, Maria Leonor Pacheco, Daniel E. AcunaAI for ScienceAdversarial Attacks on LLMs

  35. A Study on Question-Answer Dataset for LLM Safety Evaluation with a Focus on Illegal Activities

    May 28, 2026Kenji Imamura, Masao Ideuchi, Atsushi FujitaAI Safety EvaluationLLM Safety Evaluation

  36. Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents

    May 28, 2026Aditya Nawal, Manit Baser, Mohan GurusamyAI Agent Security BenchmarksLLM Safety Evaluation

  37. Code as a Weapon: A Consensus-Labeled Prompt Bank for Measuring Coding-Model Compliance with Malicious-Code Requests

    May 27, 2026Richard J. Young, Gregory D. MoodyClassificationLLM Safety Evaluation

  38. Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems

    May 26, 2026Aman Priyanshu, Supriti Vijay, Esha PahwaData LeakageMulti-Agent LLM Systems

  39. When Medical Safety Alignment Fails: A Benchmark for Evaluating LLMs on High-Risk Medical Queries

    May 26, 2026Yige Li, Jun Sun, Wei Zhao +5LLM Safety BenchmarksHealthcare

  40. KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models

    May 26, 2026Wajdi Zaghouani, Shimaa Amer Ibrahim, Aruzhan Muratbek +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  41. Preferred, Not Safer: Pairwise Preference Is a Poor Proxy for Clinical Safety

    May 25, 2026Fay Elhassan, David Sasu, Alexandra Kulinkina +2LLM Safety BenchmarksHuman Preference Evaluation

  42. SafetyRepro: Configuration-Conditional Rank Instability on Alignment Benchmarks

    May 25, 2026Yanhang Li, Zhichao Fan, Zexin ZhuangPairwise ComparisonPairwise Preference Evaluation

  43. From Automation to Collaboration: Human-in-the-Loop Methods for Safe and Trustworthy NLP

    May 24, 2026Most. Sharmin Sultana Samu, MD. Tanvir Ahmed Seum, Md. Rakibul IslamLLM AuditingHuman-in-the-Loop Annotation

  44. Furina: Fragmented Uncertainty-Driven Refusal Instability Attack

    May 24, 2026Tongxi Wu, Jian Zhang, Yang GaoAdversarial Attacks on VLMsLLM Safety

  45. Open-source LLMs administer maximum electric shocks in a Milgram-like obedience experiment

    May 20, 2026Roland Pihlakas, Jan Llenzl DagohoyLLM Refusal BehaviorLLM Safety Evaluation

  46. RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts

    May 20, 2026Lukas Weidener, Marko Brkić, Mihailo Jovanović +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  47. Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents

    May 18, 2026Ahmad Al-Tawaha, Shangding Gu, Peizhi Niu +2Long-Horizon Agent EvaluationLLM Safety Evaluation