Language Model Safety Evaluation

Latest papers 347

All topics
CardsList
  1. When and How Severely: Scenario-Specific Safety Envelopes for Driving VLAs

    Jun 12, 2026Abhinaw Priyadershi, Jelena FrtunikjVLMs for Autonomous DrivingLanguage Model Safety Evaluation

  2. RogueAI: A Reverse Turing Test for Detecting Licensed AI Deception in Dialogue

    Jun 11, 2026Sara Candussio, Emanuele Ballarin, Lorenzo Bonin +2AI Agent ReliabilityLanguage Model Safety Evaluation

  3. Prefill Awareness in Large Language Models

    Jun 10, 2026Andy Wang, Parv Mahajan, David Demitri Africa +3Language Model Safety EvaluationLLM Auditing

  4. Schützen: Evaluating LLM Safety in Bulgarian and German Contexts

    Jun 9, 2026Kiril Georgiev, Yuxia Wang, Dimitar Iliyanov Dimitrov +2LLM Safety BenchmarksMultilingual Language Model Evaluation

  5. CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs

    Jun 9, 2026Joachim Schaeffer, Alexander Panfilov, Thomas Jiralerspong +4Language Model Safety EvaluationAI Agent Security Benchmarks

  6. Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models

    Jun 9, 2026Prajakta Kini, Avinash Reddy, Souradip Chakraborty +4LLM AlignmentLanguage Model Safety Evaluation

  7. When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models

    Jun 9, 2026Sai Kartheek Reddy Kasu, Nils Lukas, Samuele PoppiCoT FaithfulnessLLM Alignment

  8. What the Eyes See, the LLMs Miss: Exploiting Human Perception for Adversarial Text Attacks

    Jun 8, 2026Qin Yang, Lu Malloy, Joshua Lee +4Language Model Safety EvaluationBlack-Box Adversarial Attacks

  9. Emergent alignment and the projectability of ethical personas

    Jun 8, 2026Guillermo Del Pinal, Youngchan Lee, Calum McNamara +1Moral Reasoning in Language ModelsLanguage Model Safety Evaluation

  10. Diffuse AI Control on Fuzzy Tasks

    Jun 8, 2026Mikhail Terekhov, Caglar Gulcehre, Vivek Hebbar +1Adversarial Prompt GenerationLanguage Model Safety Evaluation

  11. Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation

    Jun 7, 2026Qi Cao, Jian Lou, Meiting Liu +4Language Model Safety EvaluationLLM Safety

  12. When Behavioral Safety Evaluation Fails: A Representation-Level Perspective

    Jun 6, 2026Enyi Jiang, Anders Gjølbye, Yibo Jacky Zhang +1Language Model Safety EvaluationLLM Auditing

  13. Stress-testing medical large language models reveals latent safety pathology beyond benchmark accuracy

    Jun 6, 2026Yuan Shen, Xiaojun Wu, Linghua YuLLM EvaluationLanguage Model Safety Evaluation

  14. CogManip: Benchmarking Manipulative Behavior in Multi-Turn Interactions with Large Language Model

    Jun 4, 2026Zeyang Yue, Chenfei Yan, Feifei Zhao +5Language Model Safety EvaluationLLM Auditing

  15. SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech

    Jun 4, 2026Virginia Ceccatelli, Yejin Jeon, David Ifeoluwa AdelaniAudio-Language Model EvaluationLanguage Model Safety Evaluation

  16. Beyond WER: A Paired Acoustic Stress Test for Ambient Clinical Scribes

    Jun 4, 2026Xiao-Hang Jiang, Han-Jie Guo, Ying-Si Liang +4ASR EvaluationLanguage Model Safety Evaluation

  17. Voices Across Registers: Corpus-Conditioned Vernacular Jailbreaks against Aligned LLMs via Fanfiction Subgenres

    Jun 3, 2026Zhongze Luo, Ruihe Shi, Zhenshuai Yin +3Adversarial Prompt GenerationLanguage Model Safety Evaluation

  18. Safety Measurements for Fine-tuned LLMs Should be Grounded in Capability

    Jun 2, 2026Krishnapriya Vishnubhotla, Hillary Dawkins, Isar Nejadgholi +1Language Model Safety EvaluationLLM Fine-Tuning

  19. Evaluating LLMs' Effectiveness on Real-World Consumer Device Repair Questions

    Jun 2, 2026Atm Mizanur Rahman, Md Arid Hasan, Syed Ishtiaque Ahmed +1Multilingual Language Model EvaluationLLM Evaluation

  20. TriEval: A Resource-Efficient Pipeline for LLM Bias, Toxicity, and Truthfulness Assessment

    Jun 2, 2026Akshatha Srikantha, Manpreet Singh, Yash Jajoo +1LLM EvaluationLanguage Model Safety Evaluation

  21. Investigating and Alleviating Harm Amplification in LLM Interactions

    Jun 1, 2026Ruohao Guo, Wei Xu, Alan RitterLanguage Model Safety EvaluationLLM Safety

  22. SentGuard: Sentence-Level Streaming Guardrails for Large Language Models

    Jun 1, 2026Jiaqi Yu, Xin Wang, Yixu Wang +4Language Model Safety EvaluationLLM Guardrails