LLM Safety

LLM: Large Language Model

Momentum

36 papers in the last four weeks, up 200% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 272

All topics
CardsList
  1. I'm Sorry Driver, I'm Afraid I Can't Do That: Appraising the Safety of LLMs within Automotive Contexts

    Jun 12, 2026Shaun Feakins, Ibrahim Habli, Kim Littler +1Language Model-Based ControlLanguage Model Safety Evaluation

  2. BELLS-O: Evaluating the Operational Trade-offs of LLM Supervision Systems

    Jun 12, 2026Leonhard Waibl, Felix Michalak, Hadrien MariacciaLLM Safety BenchmarksLLM Guardrails

  3. A Safety-First Gateway Architecture for Trusted Public Health Resource Navigation

    Jun 11, 2026Ben Torkian, Jun ZhouLLM GuardrailsLLM Safety

  4. LoMC: Localized Multidirectional Correction for Refusal Suppression in Routed Foundation Models

    Jun 10, 2026Yan Hong, Kedong Xiu, Wei Li +6Mixture-of-Experts Language ModelsLLM Refusal Behavior

  5. DrugBench: Evaluating AI Control Protocols for Medication Harm Mitigation

    Jun 10, 2026Guido Freire, Agustín Martínez-Suñé, Viviana CotikHealthcareAI Control

  6. Schützen: Evaluating LLM Safety in Bulgarian and German Contexts

    Jun 9, 2026Kiril Georgiev, Yuxia Wang, Dimitar Iliyanov Dimitrov +2LLM Safety BenchmarksMultilingual Language Model Evaluation

  7. PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models

    Jun 8, 2026Gianluca Barmina, Federico Torrielli, Sven Harms +7Emotional Support ConversationMental Health

  8. Personalization Meets Safety:Mechanisms,Risks,and Mitigations in Personalized LLMs

    Jun 8, 2026Yanyan Luo, Xue Han, Ruiqiao Bai +10LLM PersonalizationLLM Safety

  9. Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation

    Jun 7, 2026Qi Cao, Jian Lou, Meiting Liu +4Language Model Safety EvaluationLLM Safety

  10. GIScholarBench: Benchmarking LLM Overconfidence in GIS Research

    Jun 6, 2026Zongrng Li, Mingzheng Yang, Lei Zou +8LLM EvaluationAI-Assisted Scientific Research

  11. CogManip: Benchmarking Manipulative Behavior in Multi-Turn Interactions with Large Language Model

    Jun 4, 2026Zeyang Yue, Chenfei Yan, Feifei Zhao +5Language Model Safety EvaluationLLM Auditing

  12. CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning

    Jun 4, 2026Rahul Markasserithodi, Aditya Joshi, Yuekang Li +3Adversarial TrainingAdversarial Prompt Generation

  13. When Autoregressive Consistency Hurts Safety Alignment

    Jun 2, 2026Bochen Lyu, Yiyang Jia, Xiaohao Cai +1Adversarial Attacks on LLMsLLM Safety Alignment

  14. Large Language Models Hack Rewards, and Society

    Jun 2, 2026Wei Liu, Xinyi Mou, Hanqi Yan +2Reward HackingRL for Language Models

  15. PsychoPass: Geometric Profiling of Multi-Turn Adversarial LLM Conversations

    Jun 2, 2026Muberra Ozmen, Subhabrata MajumdarAdversarial Attacks on LLMsLLM Safety

  16. MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models

    Jun 1, 2026Yingzi Ma, Zhengyue Zhao, Xiaogeng Liu +3Masked Diffusion ModelsAdversarial Attacks on LLMs

  17. Food Noise & False Safety: A Systematic Evaluation of How LLMs Fail to Adapt to Eating Disorder Queries with Clinician Feedback

    Jun 1, 2026Giulia Pucci, Emily Hemendinger, Ruizhe Li +3Mental HealthLLM Safety

  18. Investigating and Alleviating Harm Amplification in LLM Interactions

    Jun 1, 2026Ruohao Guo, Wei Xu, Alan RitterLanguage Model Safety EvaluationLLM Safety

  19. SentGuard: Sentence-Level Streaming Guardrails for Large Language Models

    Jun 1, 2026Jiaqi Yu, Xin Wang, Yixu Wang +4Language Model Safety EvaluationLLM Guardrails

  20. THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models

    Jun 1, 2026Zhiqing Ma, Zhonghao Xu, Dong Yu +3LLM SafetyMulti-Turn Jailbreak Attacks

  21. Low-Resource Safety Failures Are Action Failures, Not Representation Failures

    May 31, 2026Rashad Aziz, Ikhlasul Akmal Hanif, Fajri KotoLanguage Model CalibrationLLM Safety

  22. Lost in Delusion: Examining LLM Safety Under User Delusions and Distress

    May 31, 2026Andrew Aquilina, Chetna Nihalani, Vasudha Varadarajan +3Mental HealthLLM Safety Alignment

  23. Large Language Models Should Learn Personalized Rather Than Aggregated Human Preferences

    May 30, 2026Cristina GarbaceaLLM AlignmentSocial Choice Theory

  24. Dialectics of Alignment: Harnessing Unsafe Knowledge for Dynamic Safety Routing

    May 30, 2026Maryam Hashemzadeh, Jerry Huang, Minseon Kim +2LLM Safety AlignmentLLM Safety

  25. Emergent Languages in Populations of Language Model Agents: From Token Efficiency to Oversight Evasion

    May 29, 2026Stine Lyngsø Beltoft, William Brach, Federico Torrielli +5LLM SecurityLLM Safety

  26. EvoDefense: Co-Evolving Black-Box Defense with Large Language Models

    May 29, 2026Yu Li, Yuenan Hou, Yingmei Wei +2Evolutionary OptimizationAdversarial Attacks on LLMs

  27. CSULoRA: Closest Safe Update Low-Rank Adaptation

    May 28, 2026Oleksandr Marchenko Breneur, Adelaide Danilov, Aria Nourbakhsh +1Adapter TuningLow-Rank Adaptation