LLM Safety Alignment

LLM: Large Language Model

Momentum

25 papers in the last four weeks, up 14% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 236

All topics
CardsList
  1. The Profit Alignment Problem: How Profit Mandates Induce Alignment Failures in LLMs

    Sep 7, 2026Eric SoLLM AlignmentLanguage Model Safety Evaluation

  2. HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals

    Sep 3, 2026Jasmine Brazilek, Miles Tidmarsh, Matthias Endres +2Moral Reasoning in Language ModelsLLM Safety Alignment

  3. Representational alignment yields generalizable safety in language models

    Sep 3, 2026Lingyu Li, Yan Teng, Yingchun Wang +1Moral Reasoning in Language ModelsLLM Safety Alignment

  4. SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment

    Sep 2, 2026Qinghua Mao, Wanying Qu, Dadi Guo +8LLM Safety AlignmentLLM Agent Safety

  5. SEAL: Reinforcing Global Safety in Mixture-of-Experts through Shared Expert ALignment

    Sep 2, 2026Qingyu Meng, Yiwei Zha, Jiahuan Pei +3LLM Safety AlignmentJailbreak Defense

  6. When Safety Routing Breaks: Understanding Alignment Fragility under Benign Fine-Tuning

    Sep 1, 2026Yitong Guo, Xiaoyi Chen, Siyuan Zhang +2LLM Fine-TuningLLM Safety Alignment

  7. Trust Your Guide Only When Certain: Uncertainty-Aware Sparse Alignment at Inference Time

    Sep 1, 2026Zeen Zhu, Zhuo Li, Weiyang Guo +4LLM Safety AlignmentInference-Time Language Model Alignment

  8. Beyond Token-Level Guidance: Inference-Time Alignment of Specialized LLMs via Cross-Family Representation Steering

    Aug 31, 2026Jin Gan, Xin Li, Jun LuoLLM Safety AlignmentLanguage Modeling

  9. ALTSTEER: Selective Safety Steering for Moving Beyond Hard Refusals to Constructive Alternatives

    Aug 31, 2026Hoejoon Kwon, Byeonggeuk Lim, Kahyeon Kim +1Language Model SteeringLLM Safety Alignment

  10. Balancing Privacy, Utility, and Safety in LLM Alignment through Preference Optimization

    Aug 31, 2026Dishu Yang, Jingjing Liu, Jize LiLLM AlignmentMemorization in Language Models

  11. When Safety Speaks a Language: A Mechanistic Analysis of Safety-Language Identity Entanglement in LLMs

    Aug 30, 2026Apoorva Upadhyaya, Sandipan SikdarLLM Safety AlignmentMechanistic Interpretability

  12. Automated Researchers Can Mitigate Well-characterized Alignment Failures

    Aug 28, 2026Chen Yueh-Han, Jiaxin Wen, Jan Hendrik KirchnerAI AlignmentLLM Safety Alignment

  13. Synthetic Persona Pretraining: Alignment from Token Zero

    Aug 13, 2026Julian Minder, Viktor Moskvoretskii, Raghav Singhal +12Synthetic Data PretrainingLLM Alignment

  14. Refusing Intent, Not Form: Wrapper-Based Intent-Group Supervision for LLM Safety

    Aug 13, 2026Ping Wu, Haibo Tong, Feifei Zhao +7LLM Safety AlignmentLLM Refusal Behavior

  15. Follow the Norm: Accounting for Fine-Tuning and Prompt Effects on Model Rationales

    Aug 13, 2026Long Hoang Nguyen, Brice Valentin Kok-Shun, Guangyu Du +1Moral Reasoning in Language ModelsNormative Conformity in Language Models

  16. HiRoute: Hierarchical Routed Prompt Tuning for Safety Alignment of Large Language Models

    Aug 13, 2026Fangzhou Chen, Shiji Zhao, Mengyang Wang +4LLM Safety AlignmentPrompt Tuning

  17. ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents

    Aug 12, 2026Yutao Mou, Pengfei Yang, Zhe Yin +6AI Agent EvaluationAdversarial Scenario Generation

  18. From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop

    Aug 11, 2026Rahul Gupta, Abhinav Mohanty, Anaelia Ovalle +10LLM InterpretabilityLLM Safety Alignment

  19. The Illusion of Cross-Lingual Safety in Low-Resource Languages

    Aug 11, 2026Abigail Oppong, P Sam Sahil, Tadesse Destaw Belay +12LLM Safety AlignmentLow-Resource Language Processing

  20. Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs

    Aug 10, 2026Hongli Shen, Shaopeng Fu, Qinbo Zhang +2Adversarial TrainingAdversarial Attacks on LLMs

  21. Who Bridges Safety? Identifying and Targeting Cross-Lingual Shared Safety Pathways

    Aug 10, 2026Shuyi Miao, Wangjie Qiu, Pengyang Shao +4LLM Safety AlignmentLLM Safety

  22. Safety Cost of Steering Vectors Is Separable and Reducible

    Aug 9, 2026Yuxiao Li, Gjergji KasneciLanguage Model SteeringLLM Safety Alignment

  23. Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits

    Aug 7, 2026Elena Dumitrescu, Gert Lek, Lydia Y. Chen +1Adversarial Attacks on LLMsLLM Safety Alignment

  24. Mood Matters: How Syntactic Sensitivity Undermines Safety Alignment

    Aug 5, 2026Alina Klerings, Jannik Brinkmann, Heiner Stuckenschmidt +1Adversarial Attacks on LLMsLLM Safety Alignment

  25. Gradient Immunity: Null-Space Resistance to Malicious Fine-Tuning

    Aug 5, 2026Yuxuan Huang, Xingyu Zeng, Tianhang Zheng +1LLM Safety AlignmentLLM Security

  26. Looking in the Mirror: Introspecting Side-Effect Misalignments Induced by Fine-Tuning

    Aug 5, 2026Kotaro Yoshida, Laura Gomezjurado Gonzalez, Yukinori Yamamoto +3LLM AuditingLanguage Model Introspection