LLM Safety Alignment

LLM: Large Language Model

Momentum

25 papers in the last four weeks, up 14% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 236

All topics
CardsList
  1. ReSI: Recursive Safety Improvement toward Resistant and Resilient AI

    Oct 8, 2026Jingnan Zheng, Dongcheng Zhang, Yi Zhang +10LLM Safety AlignmentRecursive Self-Improvement

  2. Distillation for Incrimination and Distillation for Capabilities

    Oct 7, 2026Sebastian Prasanna, Jacqueline Tay, Alek WestoverLLM Safety AlignmentLanguage Model Distillation

  3. How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense

    Oct 7, 2026Zhankai Ye, Yanning Wang, Yukai Jin +5Refusal Behavior in Language ModelsLLM Safety Alignment

  4. SLDR: Defending Against Malicious Fine-tuning via Selective Layers Recovery and Dynamic Routing

    Oct 7, 2026Hui Zhang, Yachao Yuan, Jiayun Wang +3LLM SecurityLLM Safety

  5. SafeEvo: Deciphering the Safety Alignment Mechanism and Evolution in Language Models

    Oct 7, 2026Miao Yu, Hao Huang, Lu Yuan +3LLM Safety AlignmentLLM Alignment

  6. The Model Plants the Trigger: Answer-Side Backdoor Attacks in Multi-Turn Large Language Models

    Oct 6, 2026Yibo Zhang, Tianrong Guan, Liang Lin +3LLM Backdoor AttacksBackdoor Attacks

  7. TRACE: Trajectory Return Attribution and Contrastive Erasure for Multi-Turn Safety

    Oct 1, 2026Fengpeng Li, Kemou Li, Qizhou Wang +3LLM Fine-TuningAdversarial Attacks on LLMs

  8. CodeMimicry: Exploiting Safety Generalization Lag in Large Language Models via Structured Code Completion

    Sep 30, 2026Zhen Liang, Hai Huang, Wentao ChenAdversarial Attacks on LLMsJailbreak Attacks

  9. Faithful Dual-constrained Erasure for Robust LLM Safety Alignment

    Sep 30, 2026Jiaqing Li, Shide Zhou, Zhibo Zhang +3LLM Safety AlignmentMachine Unlearning

  10. Alignment via Training Against Probes Without Losing Monitorability

    Sep 29, 2026Lena Libon, Alexander Panfilov, Ben Rank +3Fine-TuningLLM Safety Alignment

  11. ACTR: Aligning Thoughts and Responses for Multilingual Safety in Reasoning LLMs

    Sep 29, 2026Xianhui Zhang, Jian Yu, Chengyu Xie +6Adversarial Attacks on LLMsLLM Safety Alignment

  12. Safer Content or Firmer Refusals? A Hybrid Perturbation Defense for Alignment under Harmful Fine-tuning

    Sep 29, 2026Muhammad Zeeshan Akram, Mufid Kamel Marican, Anvesh Reddy Yenugu +2LLM Safety AlignmentAdversarial Robustness of Language Models

  13. The Safety Operator: Modulating the Expression of Safety Instructions via Spectral Optimization

    Sep 29, 2026Benoit Dherin, Michael Munn, Xavier Gonzalvo +14LLM Safety AlignmentLLM Safety

  14. See it, Say it, Sorted: Mechanistic Diagnosis and Parameter-Space Mitigation of Emergent Misalignment in LLMs

    Sep 28, 2026Weiqiao Que, Ruizhe Li, Chengyu Wang +3Emergent Misalignment in Language ModelsLLM Safety Alignment

  15. DeShortcut-Align: Decoupling Spurious Shortcuts for Robust Safety Alignment in Large Reasoning Models

    Sep 28, 2026Qirui Liu, Yichen Sun, Yan Wang +4LLM Safety AlignmentAdversarial Robustness of Language Models

  16. When Do Model Internals Help? Exploring the Role of Representation Engineering in LLM Safety

    Sep 28, 2026Tianyi Guan, Jianhui Chen, Liangming PanLanguage Model Safety EvaluationLLM Interpretability

  17. EOPSA: Efficient On-Policy Self-Distilled Safety Alignment

    Sep 28, 2026Qirui Liu, Yichen Sun, Yan Wang +5On-Policy Self-DistillationSelective Knowledge Distillation

  18. SafeMol: Dual-Modality Safety Alignment for Molecular Multimodal Models

    Sep 27, 2026Xinmiao Wang, Ruijie Wang, Menghui Wang +5Adversarial Attacks on LLMsLLM Safety Alignment

  19. Syndrome, Synergy, and Safety: Structured Reasoning and Knowledge-Driven Alignment for TCM Prescription Generation

    Sep 22, 2026Zheng Chen, ZhiCheng Du, Haoxuan Li +1LLM AlignmentCoT Reasoning

  20. A2^2Safe: Counterfactual Evidence-Aligned Adaptive Agent Collaboration for Safe and Effective Visual Question Answering

    Sep 21, 2026Quanxing Xu, Ling Zhou, Xian Zhong +4Visual Question AnsweringLLM Safety Alignment

  21. AUDITPLAN: Commit, Then Answer for Auditable Safety Alignment

    Sep 16, 2026Sai Sri Pushpa Jampani, Kshitij Mishra, Asif EkbalLLM AlignmentLLM Auditing

  22. First Token Matters: Understanding Safety Collapse in Large Reasoning Models

    Sep 16, 2026Yizheng Yang, Haining Yu, Yuechen Wang +4LLM Safety AlignmentInference-Time Intervention

  23. AI Safety: Not Optional, Not Later

    Sep 14, 2026Qinghua Lu, Yoshua BengioAI AssuranceAI Accountability

  24. An Efficient and Modular Framework for Targeted Harm Mitigation in LLMS

    Sep 12, 2026Roberto Campbell, Momin Abbass, Muneeza Azmat +5LLM Safety AlignmentLow-Rank Adaptation

  25. Suan: Rectifying Direct Preference Safety Alignment in Large Language Models

    Sep 8, 2026Oleksandr Cherednichenko, Roman KlypaLLM AlignmentLLM Safety Alignment

  26. Does Deeper Reasoning Compromise Alignment? Revealing and Mitigating of Alignment Collapse in Large Reasoning Models

    Sep 8, 2026Yu-Hang Wu, Yu-Jie Xiong, Henghua Zhang +3Adversarial Attacks on LLMsJailbreak Attacks