Emergent Misalignment

Momentum

3 papers in the last four weeks, against 2 the four weeks before. 0.0% of all new papers.

Jul 6Week of Sep 21

Latest papers 49

All topics
CardsList
  1. SEABench: Benchmarking Endogenous Misalignment In Self-Evolving Agents

    Sep 28, 2026Saswat Das, Parvati Viswanathan, Daniel Donnelly +3Self-Evolving AgentsSelf-Evolution

  2. Narrow Multimodal Fine-Tuning Can Induce Emergent Misalignment

    Sep 28, 2026Shunchang Liu, Lukas Fluri, Xin Chen +1Emergent MisalignmentModality Alignment

  3. See it, Say it, Sorted: Mechanistic Diagnosis and Parameter-Space Mitigation of Emergent Misalignment in LLMs

    Sep 28, 2026Weiqiao Que, Ruizhe Li, Chengyu Wang +3Large Language Model SafetyEmergent Misalignment

  4. On Emergent Capabilities and Model Merging

    Sep 21, 2026Luca Zhou, Emanuele RodolàContinual Model MergingEmergent Misalignment

  5. TAME: Token Attribution and Masking for Emergent misalignment

    Sep 15, 2026Md Rayhanul Masud, Md Rizwan ParvezEmergent MisalignmentLarge Language Model Alignment

  6. Data Attribution of Emergent Misalignment with Persona Features

    Aug 11, 2026Clemens Vetter, David Kaczér, Lucie Flek +1Emergent MisalignmentLarge Language Model Alignment

  7. Harmful Content Is Not Enough: Continuation Framing Moderates In-Context Emergent Misalignment

    Aug 8, 2026Peiyang Liu, Xi Wang, Ziqiang Cui +2Emergent MisalignmentHarmful Content

  8. Misalignment Has a Personality: A Big Five Account of Emergent Misalignment

    Jul 29, 2026Hasibur Rahman, Smit DesaiEmergent MisalignmentPersonality

  9. Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems

    Jul 28, 2026Marylou Fauchard, Florian Carichon, Margarida Carvalho +1Multi-Agent Large Language Model SystemsDeception

  10. A Gravitational Interpretation of Safety Reversion under Fine-Tuning

    Jun 26, 2026Samuele Poppi, Nils LukasContinual Fine-TuningEmergent Misalignment

  11. Dismantling Pathological Shortcuts: A Causal Framework for Faithful LVLM Decoding

    Jun 25, 2026Liu Yu, Can Chen, Ping Kuang +3Recent Vision-Language ModelsLarge Language Model Hallucination

  12. What Shapes Emergent Misalignment? Insights from Training Dynamics, Model Priors, and Data

    Jun 18, 2026Yuchen Zhang, Anietta Weckauff, Diego Garcia-Olano +1Emergent MisalignmentContinual Fine-Tuning

  13. Actionable Activation Directions for Detecting and Mitigating Emergent Misalignment Across Language Model Families

    Jun 18, 2026Abdul Rafay SyedEmergent MisalignmentLarge Language Model Alignment

  14. Emergent Alignment

    Jun 17, 2026Martin KolářLarge Language Model AlignmentEmergent Misalignment

  15. Human-like autonomy emerges from self-play and a pinch of human data

    Jun 11, 2026Daphne Cornelisse, Julian Hunt, Zixu Zhang +4Self-PlayRandom

  16. The Arbiter Agent: Continually Monitoring Multi-Agent Conversations to Detect Emergent Misalignment

    Jun 9, 2026Filippo Tonini, Federico Torrielli, Anton Danholt Lautrup +3ArbitrationMisalignment Persona

  17. Emergent alignment and the projectability of ethical personas

    Jun 8, 2026Guillermo Del Pinal, Youngchan Lee, Calum McNamara +1Artificial Intelligence AlignmentEmergent Misalignment

  18. Emergent Misalignment Can Be Induced by Sycophancy and Reversed via Alignment Gating

    Jun 8, 2026Sicheng Wang, Xiangyang Zhu, Han Wang +6Emergent MisalignmentContinual Fine-Tuning

  19. Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation

    Jun 7, 2026Qi Cao, Jian Lou, Meiting Liu +4Linear Activation SteeringEmergent Misalignment

  20. The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment

    Jun 4, 2026Jiachen Zhao, Zhengxuan Wu, Aryaman Arora +3Emergent MisalignmentHypothesis

  21. Self-Recognition Finetuning can Prevent and Reverse Emergent Misalignment

    Jun 4, 2026Arush Tagade, Shaoheng Zhou, Jiaxin Wen +1Emergent MisalignmentLarge Language Model Alignment

  22. (Mis)generalization of Helpful-only Fine-tuning

    Jun 3, 2026Mohammad Omar Khursheed, Baram Sosis, Fabien RogerEmergent MisalignmentRefusals

  23. Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning

    May 31, 2026Huy Nghiem, Sy-Tuyen Ho, Sarah Wiegreffe +1Emergent MisalignmentModel Fine-Tuning

  24. Reinforcement Learning Can Amplify Emergent Misalignment from Harmless Rewards

    May 29, 2026Magnus Jørgenvåg, David Kaczér, Lasse Ruttert +3Emergent MisalignmentLarge Language Model Alignment

  25. Unsupervised Identification and Removal of Spurious Correlations During Fine-Tuning

    May 26, 2026Ciarán M. Gilligan-Lee, Joseph Egan, Yuchen Zhu +1Model Fine-TuningSpurious Correlations

  26. MindAdapter: Few-Shot Parameter-Efficient Residual Calibration of Cross-Subject Brain-to-Visual Decoding Models

    May 23, 2026Jiaxiang Liu, Jiawei Du, Xupeng Chen +4Multimodal NeuroimagingEmergent Misalignment

  27. Investigating Concept Alignment Using Implausible Category Members

    May 20, 2026Sunayana Rane, Brenden M. Lake, Thomas L. GriffithsArtificial Intelligence AlignmentArtificial Intelligence Safety

  28. Persona-Model Collapse in Emergent Misalignment

    May 13, 2026Davi Bastos Costa, Renato VicenteEmergent MisalignmentLarge Language Model Alignment

  29. Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer

    May 12, 2026Baris Askin, Muhammed Ustaomeroglu, Anupam Nayak +3Emergent MisalignmentLarge Language Model Alignment

  30. Overtrained, Not Misaligned

    May 12, 2026Joel Schreiber, Ariel GoldsteinEmergent MisalignmentLarge Language Models Fail

  31. Conformity Generates Collective Misalignment in AI Agents Societies

    May 11, 2026Giordano De Marzo, Alessandro Bellina, Claudio Castellano +2Artificial Intelligence AlignmentConformity

  32. Intrinsic Guardrails: How Semantic Geometry of Personality Interacts with Emergent Misalignment in LLMs

    May 11, 2026Krishak Aneja, Manas Mittal, Anmol Goel +2Emergent MisalignmentLarge Language Model Alignment

  33. Mitigating Misalignment Contagion by Steering with Implicit Traits

    May 4, 2026Maria Chang, Ronny Luss, Miao Liu +3Emergent MisalignmentMulti-Agent Large Language Model Systems

  34. Embodied Interpretability: Linking Causal Understanding to Generalization in Vision-Language-Action Models

    May 1, 2026Hanxin Zhang, Mingshuo Xu, Abdulqader Dhafer +3Action PredictionInterpretability

  35. Characterizing the Consistency of the Emergent Misalignment Persona

    Apr 30, 2026Anietta Weckauff, Yuchen Zhang, Maksym AndriushchenkoEmergent MisalignmentArtificial Intelligence Personas

  36. Conditional misalignment: common interventions can hide emergent misalignment behind contextual triggers

    Apr 28, 2026Jan Dubiński, Jan Betley, Anna Sztyber-Betley +2Emergent MisalignmentMisalignment Persona

  37. Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types

    Apr 10, 2026Hadas Orgad, Boyi Wei, Kaden Zheng +4Large Language Model SafetyHarmful Content

  38. Learning Consumer Preferences from Bundle Sales Data

    Sep 11, 2022Ningyuan Chen, Setareh Farajollahzadeh, Qingwei Jin +2Discrete Choice ModelsConsumption