LLM Safety Alignment

LLM: Large Language Model

Momentum

25 papers in the last four weeks, up 14% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 236

All topics
CardsList
  1. Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms

    May 8, 2026Linh Le, David Williams-King, Mohamed Amine Merzouk +2Adversarial TrainingNeural Network Robustness

  2. The Attacker in the Mirror: Breaking Self-Consistency in Safety via Anchored Bipolicy Self-Play

    May 8, 2026Gabriele La Malfa, Emanuele La Malfa, Saar Cohen +4Self-Play RLLanguage Model Safety Evaluation

  3. Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment

    May 8, 2026Zhixue Song, Boyan Han, Yiwei Wang +1VLM RobustnessAdversarial Attacks on VLMs

  4. Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks

    May 7, 2026Guoxin Lu, Letian Sha, Qing Wang +4LLM Fine-TuningLLM Safety Alignment

  5. Self-Mined Hardness for Safety Fine-Tuning

    May 4, 2026Prakhar Gupta, Garv Shah, Donghua ZhangHard Negative MiningLLM Fine-Tuning

  6. Model Spec Midtraining: Improving How Alignment Training Generalizes

    May 3, 2026Chloe Li, Nevan Wichers, Sara Price +2LLM AlignmentLLM Safety Alignment

  7. RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs

    May 3, 2026Sadia Asif, Mohammad Mohammadi AmiriFine-TuningLLM Fine-Tuning

  8. Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment

    May 3, 2026Jiajia Li, Xiaoyu Wen, Zhongtian Ma +3LLM AlignmentLLM Safety Alignment

  9. Multilingual Safety Alignment via Self-Distillation

    May 3, 2026Ruiyang Qin, Qingzhuo Wang, Dongrui Liu +3Multilingual Language ModelsLLM Safety Alignment

  10. A Theoretical Game of Attacks via Compositional Skills

    May 1, 2026Xinbo Wu, Huan Zhang, Abhishek Umrawal +1Adversarial Prompt GenerationAdversarial Attacks on LLMs

  11. ARMOR 2025: A Military-Aligned Benchmark for Evaluating Large Language Model Safety Beyond Civilian Contexts

    Apr 30, 2026Sydney Johns, Heng Jin, Chaoyu Zhang +2LLM Safety BenchmarksLLM Safety Alignment

  12. Attention Is Where You Attack

    Apr 30, 2026Aviral Srivastava, Sourav PandaSelf-AttentionAdversarial Attacks

  13. Tatemae: Detecting Alignment Faking via Tool Selection in LLMs

    Apr 29, 2026Matteo Leonesi, Francesco Belardinelli, Flavio Corradini +1Deception in Language ModelsLLM Safety Alignment

  14. Test-Time Safety Alignment

    Apr 28, 2026Baturay Saglam, Dionysis KalogeriasWord EmbeddingsLLM Safety Alignment

  15. Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment

    Apr 28, 2026James Pustejovsky, Nikhil KrishnaswamyRL for Language ModelsLanguage Model Safety Evaluation

  16. Evaluating Risks in Weak-to-Strong Alignment: A Bias-Variance Perspective

    Apr 28, 2026Hamid Osooli, Kareema Batool, Rick Gentry +3LLM Safety AlignmentWeak-to-Strong Generalization

  17. Multilingual Refusal Alignment for Safer Large Language Models

    Apr 24, 2026Aleksandra Krasnodębska, Wojciech Kusa, Aldo LipaniMultilingual Language Model EvaluationLLM Alignment

  18. SafeRedirect: Defeating Internal Safety Collapse via Task-Completion Redirection in Frontier LLMs

    Apr 22, 2026Chao Pan, Yu Wu, Xin YaoLLM GuardrailsLLM Safety Alignment

  19. ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward System

    Apr 20, 2026Jiacheng Liang, Yao Ma, Tharindu Kumarage +5Reward ModelingAdversarial Attacks on LLMs

  20. Adversarial Arena: Crowdsourcing Data Generation through Interactive Competition

    Apr 20, 2026Prasoon Goyal, Sattvik Sahai, Michael Johnston +14Synthetic Data GenerationLLM Safety Alignment

  21. SafeAnchor: Preventing Cumulative Safety Erosion in Continual Domain Adaptation of Large Language Models

    Apr 20, 2026Dongxin Guo, Jikun Wu, Siu Ming YiuContinual Learning for LLMsLLM Fine-Tuning

  22. Cat-DPO: Category-Adaptive Safety Alignment

    Apr 19, 2026Tiankai Yang, Yi Nian, Xinyuan Li +3LLM AlignmentDirect Preference Optimization

  23. Continual Safety Alignment via Gradient-Based Sample Selection

    Apr 19, 2026Thong Bach, Dung Nguyen, Thao Minh Le +1Continual Learning for LLMsLLM Fine-Tuning

  24. Guardrails in Logit Space: Safety Token Regularization for LLM Alignment

    Apr 19, 2026Thong Bach, Truyen TranLLM Fine-TuningLLM Safety Alignment