LLM Safety Alignment

LLM: Large Language Model

Momentum

25 papers in the last four weeks, up 14% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 236

All topics
CardsList
  1. Consistency Training Along the Transformer Stack

    Jun 4, 2026Sukrati Gautam, Neil Shah, Arav Dhoot +7Adversarial Attacks on LLMsLLM Safety Alignment

  2. Safety Paradox: How Enhanced Safety Awareness Leaves LLMs Vulnerable to Posterior Attack

    Jun 4, 2026Long P. Hoang, Hai V. Le, Shaoyang Xu +2Adversarial Attacks on LLMsLLM Safety Alignment

  3. CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning

    Jun 4, 2026Rahul Markasserithodi, Aditya Joshi, Yuekang Li +3Adversarial TrainingAdversarial Prompt Generation

  4. Self-Recognition Finetuning can Prevent and Reverse Emergent Misalignment

    Jun 4, 2026Arush Tagade, Shaoheng Zhou, Jiaxin Wen +1Emergent Misalignment in Language ModelsLLM Safety Alignment

  5. Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration

    Jun 3, 2026Cristina Carleo, Pietro Liguori, Naghmeh Ivaki +1LLM Safety AlignmentLLMs for Cybersecurity

  6. Inference-Time Vulnerability Beyond Shallow Safety: Alignment Along Generation Trajectories

    Jun 3, 2026Kyungmin Park, Taesup KimAdversarial Attacks on LLMsLLM Safety Alignment

  7. When Autoregressive Consistency Hurts Safety Alignment

    Jun 2, 2026Bochen Lyu, Yiyang Jia, Xiaohao Cai +1Adversarial Attacks on LLMsLLM Safety Alignment

  8. Expert-Aware Refusal Steering

    Jun 2, 2026Anna C. Marbut, Daniel R. Olson, Travis J. WheelerMixture-of-Experts Language ModelsLanguage Model Steering

  9. Consistency Training Can Entrench Misalignment

    Jun 2, 2026David Demitri Africa, Arathi ManiLLM Safety AlignmentEmergent Misalignment

  10. SafeGene: Reusable Adapters for Transferable Safety Alignment

    Jun 2, 2026Yanghan Wang, Zhiqiang Kou, Fu Feng +2LLM Fine-TuningLLM Safety Alignment

  11. Constitutional On-Policy Safe Distillation

    Jun 2, 2026Ming Wen, Yuxuan Liu, Kun Yang +8On-Policy Self-DistillationLLM Safety Alignment

  12. SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment

    Jun 1, 2026Hao Li, Jingkun An, Zijun Song +8LLM Safety AlignmentOn-Policy Distillation

  13. Two to Tango: Coupled Task-Reference Selection for Safe LLM Fine-tuning

    Jun 1, 2026Xinrui Chen, Jianhao Zhang, Ou Wu +1LLM Fine-TuningData Selection

  14. Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation

    Jun 1, 2026Bruce Changlong Xu, Adarsh Kumarappan, Mu ZhouLLM QuantizationKV Caching

  15. Lost in Delusion: Examining LLM Safety Under User Delusions and Distress

    May 31, 2026Andrew Aquilina, Chetna Nihalani, Vasudha Varadarajan +3Mental HealthLLM Safety Alignment

  16. Dialectics of Alignment: Harnessing Unsafe Knowledge for Dynamic Safety Routing

    May 30, 2026Maryam Hashemzadeh, Jerry Huang, Minseon Kim +2LLM Safety AlignmentLLM Safety

  17. MESA: Improving MoE Safety Alignment via Decentralized Expertise

    May 30, 2026Yitong Sun, Yao Huang, Teng Li +5Mixture-of-Experts Language ModelsLLM Safety Alignment

  18. ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails

    May 29, 2026Yan Wang, Zhixuan Chu, Zihao Xue +9LLM GuardrailsLLM Safety Alignment

  19. COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents

    May 29, 2026Wenkai Shen, Pengyang Zhou, Jiahe Xu +5LLM Safety AlignmentLLM Agents

  20. Configurable Reward Model for Balanced Safety Alignment

    May 28, 2026Zhengping Jiang, Mehran Khodabandeh, Akash Bharadwaj +5Reward ModelingLanguage Model Safety Evaluation

  21. LLUMI: Improving LLM Writing Assistance for Mental Health Support with Online Community Feedback

    May 28, 2026Jiwon Kim, Maya Ajit, Sherry Gong +4Emotional Support ConversationPrivacy-Preserving Language Models

  22. Understanding Safety-Sensitive Expert Behavior in Mixture-of-Experts LLMs

    May 28, 2026Zhibo Zhang, Yuxi Li, Zhen Ouyang +2Mixture-of-Experts Language ModelsLLM Auditing

  23. Aligned but Fragile: Enhancing LLM Safety Robustness via Zeroth-Order Optimization

    May 28, 2026Zhihao Liu, Yifan Wu, Jian Lou +3LLM AlignmentZeroth-Order Optimization

  24. Multi-Adapter Representation Interventions via Energy Calibration

    May 27, 2026Manjiang Yu, Hongji Li, Junwei Chen +4LLM AlignmentLLM Safety Alignment

  25. The Ethics of LLM Sandbox and Persona Dynamics

    May 27, 2026Tim Gebbie, Stewart GebbieLLM GuardrailsLLM Safety Alignment