LLM Safety Alignment

LLM: Large Language Model

Momentum

25 papers in the last four weeks, up 14% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 236

All topics
CardsList
  1. HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment

    Jul 1, 2026Shei Pern Chua, Hao Wu, Qianli Ma +1Adversarial Attacks on LLMsLLM Safety Alignment

  2. EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures

    Jun 29, 2026Buğra Alperen Uluırmak, Rifat KurbanAI AlignmentLLM Safety Alignment

  3. A Gravitational Interpretation of Safety Reversion under Fine-Tuning

    Jun 26, 2026Samuele Poppi, Nils LukasFine-TuningLLM Safety Alignment

  4. Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models

    Jun 26, 2026Yanchen Yin, Dongqi Han, Linghui LiAttention Head AnalysisJailbreak Attacks

  5. Low-Agreeableness Persona Conditioning for Safe LLM Fine-Tuning

    Jun 26, 2026Austin MY Cheung, Yi YangLLM Fine-TuningLLM Safety Alignment

  6. TRACE: Trajectory-Based Safety Patch Learning for LLM Post-Training Realignment

    Jun 26, 2026Changyue Li, Jiaming He, Youliang Yuan +4Supervised Fine-TuningLLM Safety Alignment

  7. RAS: Measuring LLM Safety Through Refusal Alignment

    Jun 24, 2026Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu +1LLM Safety AlignmentLLM Safety

  8. PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models

    Jun 24, 2026Chang Wu, Junfeng Fang, Houcheng Jiang +5LLM AlignmentLLM Safety Alignment

  9. Reinforcement Learning Towards Broadly and Persistently Beneficial Models

    Jun 22, 2026Akshay V. Jagadeesh, Rahul K. Arora, Khaled Saab +5LLM AlignmentLLM Safety Alignment

  10. The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs

    Jun 21, 2026Shivam Ratnakar, Kartikeya VatsLanguage Model SteeringAdversarial Attacks on LLMs

  11. Skin-Deep: A Geometric Diagnostic for Alignment Fragility in Large Language Model Representations

    Jun 21, 2026Dongyub Jude Lee, Jungseob Lee, Seungyoon Lee +5LLM InterpretabilityLLM Fine-Tuning

  12. Beyond Safe Data: Pretraining-Stage Alignment with Regular Safety Reflection

    Jun 17, 2026Jinhan Li, Kexian Tang, Yihan Xu +2Language Model PretrainingLLM Alignment

  13. AnchorKV: Safety-Aware KV Cache Compression via Soft Penalty with a Refusal Anchor

    Jun 16, 2026Ning Ni, Yingjie LaoKV CachingLLM Safety Alignment

  14. Adaptive and Explicit safe: Triggering Latent Safety Awareness in Large Reasoning Models

    Jun 15, 2026Ke Miao, Jiaxin Li, Hongliang Chen +2LLM Safety AlignmentLLM Safety

  15. SHARD: Safe and Helpful Alignment via Self-Reframing Distillation

    Jun 14, 2026Viswonathan Manoranjan, Amogh Gupta, Anvesh Rao Vijjini +2LLM Safety AlignmentLanguage Model Distillation

  16. A Virtuous AI is an Existential Risk

    Jun 11, 2026Guillermo Del Pinal, Youngchan Lee, Min OhnLLM Safety AlignmentAI Agent Safety

  17. ALIGNBEAM : Inference-Time Alignment Transfer via Cross-Vocabulary Logit Mixing

    Jun 10, 2026Chirag Chawla, Pratinav Seth, Vinay Kumar SankarapuLLM AlignmentLLM Safety Alignment

  18. Grammar-Constrained Decoding Can Jailbreak LLMs into Generating Malicious Code

    Jun 10, 2026Yitong Zhang, Shiteng Lu, Jia LiLLM Safety AlignmentLLM Jailbreak Attacks

  19. Training LLMs to Enforce Multi-Level Instruction Hierarchies via Gravity-Weighted Direct Preference Optimization

    Jun 9, 2026Lena S. Bolliger, Lena A. JägerDirect Preference OptimizationLLM Safety Alignment

  20. Emergent alignment and the projectability of ethical personas

    Jun 8, 2026Guillermo Del Pinal, Youngchan Lee, Calum McNamara +1Moral Reasoning in Language ModelsLanguage Model Safety Evaluation

  21. Distilling Safe LLM Systems via Soft Prompts for On Device Settings

    Jun 8, 2026Motasem Alfarra, Cristina Pinneri, Dana Kianfar +2On-Device Language Model InferenceLLM Safety Alignment

  22. Emergent Misalignment Can Be Induced by Sycophancy and Reversed via Alignment Gating

    Jun 8, 2026Sicheng Wang, Xiangyang Zhu, Han Wang +6LLM SycophancyLLM Alignment

  23. LCAM: A Framework for Diagnosing Interactional Alignment Failures in Con-versational AI

    Jun 6, 2026Manuele Reani, Hongyu TianLLM AlignmentLLM Safety Alignment

  24. DOG-DPO:Dynamic Optimization in Geometry for Safety Alignment

    Jun 4, 2026Yi Nian, Tiankai Yang, Yudi Zhang +7Direct Preference OptimizationLLM Safety Alignment