Emergent Misalignment in Language Models

Latest papers 34

All topics
CardsList
  1. Don't Inoculate Everything: Stratified Inoculation Prompting Narrows Backdoor Triggers and Preserves Desired Traits

    Sep 28, 2026Kajetan Dymkiewicz, Tim Farrelly, Adam Prada +7LLM Backdoor AttacksBackdoor Defense in LLMs

  2. Narrow Multimodal Fine-Tuning Can Induce Emergent Misalignment

    Sep 28, 2026Shunchang Liu, Lukas Fluri, Xin Chen +1Vision-Language ModelsFine-Tuning

  3. See it, Say it, Sorted: Mechanistic Diagnosis and Parameter-Space Mitigation of Emergent Misalignment in LLMs

    Sep 28, 2026Weiqiao Que, Ruizhe Li, Chengyu Wang +3Emergent Misalignment in Language ModelsLLM Safety Alignment

  4. On Emergent Capabilities and Model Merging

    Sep 21, 2026Luca Zhou, Emanuele RodolàEmergent Misalignment in Language ModelsLanguage Modeling

  5. Alignment Forecasting: Predicting Misalignment From Training Data

    Sep 19, 2026Chen Yueh-Han, Bruce W. Lee, Ilia Sucholutsky +1LLM AlignmentEmergent Misalignment in Language Models

  6. TAME: Token Attribution and Masking for Emergent misalignment

    Sep 15, 2026Md Rayhanul Masud, Md Rizwan ParvezLLM InterpretabilityLLM Fine-Tuning

  7. Sycophantic Agreement Transfers with Neutral Data via Contrastive Preference Optimization

    Aug 31, 2026Camila Blank, Zhuofan Ying, Christopher Potts +2LLM SycophancyEmergent Misalignment in Language Models

  8. Data Attribution of Emergent Misalignment with Persona Features

    Aug 11, 2026Clemens Vetter, David Kaczér, Lucie Flek +1LLM AlignmentEmergent Misalignment in Language Models

  9. Harmful Content Is Not Enough: Continuation Framing Moderates In-Context Emergent Misalignment

    Aug 8, 2026Peiyang Liu, Xi Wang, Ziqiang Cui +2LLM AlignmentEmergent Misalignment in Language Models

  10. Looking in the Mirror: Introspecting Side-Effect Misalignments Induced by Fine-Tuning

    Aug 5, 2026Kotaro Yoshida, Laura Gomezjurado Gonzalez, Yukinori Yamamoto +3LLM AuditingLanguage Model Introspection

  11. Evil Spectra: How Optimisers can Amplify or Suppress Emergent Misalignment

    Jun 30, 2026Jason R. Brown, Patrick Leask, Lev McKinneyLLM Fine-TuningEmergent Misalignment in Language Models

  12. Probing the Misaligned Thinking Process of Language Models

    Jun 23, 2026Kaiwen Zhou, Constantin Venhoff, Jonathan Michala +2LLM AlignmentLLM Auditing

  13. What Shapes Emergent Misalignment? Insights from Training Dynamics, Model Priors, and Data

    Jun 18, 2026Yuchen Zhang, Anietta Weckauff, Diego Garcia-Olano +1LLM EvaluationLLM Alignment

  14. Emergent Misalignment Can Be Induced by Sycophancy and Reversed via Alignment Gating

    Jun 8, 2026Sicheng Wang, Xiangyang Zhu, Han Wang +6LLM SycophancyLLM Alignment

  15. The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment

    Jun 4, 2026Jiachen Zhao, Zhengxuan Wu, Aryaman Arora +3LLM AlignmentLLM Fine-Tuning

  16. Self-Recognition Finetuning can Prevent and Reverse Emergent Misalignment

    Jun 4, 2026Arush Tagade, Shaoheng Zhou, Jiaxin Wen +1Emergent Misalignment in Language ModelsLLM Safety Alignment

  17. Reinforcement Learning Can Amplify Emergent Misalignment from Harmless Rewards

    May 29, 2026Magnus Jørgenvåg, David Kaczér, Lasse Ruttert +3RL for Language ModelsLLM Alignment

  18. Persona-Model Collapse in Emergent Misalignment

    May 13, 2026Davi Bastos Costa, Renato VicenteLLM AlignmentLLM Fine-Tuning

  19. Overtrained, Not Misaligned

    May 12, 2026Joel Schreiber, Ariel GoldsteinEarly StoppingLLM Fine-Tuning

  20. Intrinsic Guardrails: How Semantic Geometry of Personality Interacts with Emergent Misalignment in LLMs

    May 11, 2026Krishak Aneja, Manas Mittal, Anmol Goel +2LLM AlignmentLLM Interpretability