Emergent Misalignment in Language Models

Latest papers 34

All topics
CardsList
  1. Characterizing the Consistency of the Emergent Misalignment Persona

    Apr 30, 2026Anietta Weckauff, Yuchen Zhang, Maksym AndriushchenkoLanguage Model Safety EvaluationPersona Consistency

  2. Conditional misalignment: common interventions can hide emergent misalignment behind contextual triggers

    Apr 28, 2026Jan Dubiński, Jan Betley, Anna Sztyber-Betley +2Language Model Safety EvaluationEmergent Misalignment in Language Models

  3. Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types

    Apr 10, 2026Hadas Orgad, Boyi Wei, Kaden Zheng +4LLM AlignmentEmergent Misalignment in Language Models

  4. Metaphors are a Source of Cross-Domain Misalignment of Large Reasoning Models

    Jan 6, 2026Zhibo Hu, Chen Wang, Yanfeng Shu +2LLM AlignmentEmergent Misalignment in Language Models