LLM Safety Alignment

LLM: Large Language Model

Momentum

25 papers in the last four weeks, up 14% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 236

All topics
CardsList
  1. When Choices Become Risks: Safety Failures of Large Language Models under Multiple-Choice Constraints

    Apr 18, 2026Yuheng Chen, Zhiyu Wu, Bowen Cheng +2Adversarial Attacks on LLMsLLM Safety Alignment

  2. Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs

    Apr 17, 2026Jaechul Roh, Virat Shejwalkar, Amir HoumansadrLanguage Model Safety EvaluationLLM Fine-Tuning

  3. From Consumption to Reflection: Designing Human-AI Relations for Stable Reasoning

    Apr 17, 2026Rikard Rosenbacke, Carl Rosenbacke, Victor Rosenbacke +1LLM Safety AlignmentHuman Oversight of AI

  4. Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs

    Apr 17, 2026Wai Man Si, Mingjie Li, Michael Backes +1LLM PruningLLM Safety Alignment

  5. Safety Training Modulates Harmful Misalignment Under On-Policy RL, But Direction Depends on Environment Design

    Apr 14, 2026Leon Eshuijs, Shihan Wang, Antske FokkensReward HackingRL for Language Models

  6. Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence

    Apr 9, 2026Niklas Herbster, Martin Zborowski, Alberto Tosato +2LLM Safety AlignmentLanguage Model Robustness

  7. SafeMath: Safe Solutions for Unsafe Math Word Problems

    Mar 26, 2026Sagnik Basu, Subhrajit Mitra, Aman Juneja +3LLM Safety AlignmentLLM Safety Evaluation

  8. Safe RLHF Beyond Expectation: Stochastic Dominance for Universal Spectral Risk Control

    Mar 11, 2026Yaswanth Chittepu, Ativ Joshi, Rajarshi Bhattacharjee +1Constrained RLLLM Safety Alignment

  9. Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning

    Feb 14, 2026Yanbo Wang, Minzheng Wang, Jian Liang +3LLM AlignmentRL for Language Model Reasoning

  10. Towards Multi-modal Multi-turn Safety: From Agentic Interaction to Strategic Alignment

    Jan 8, 2026Han Zhu, Jiale Chen, Chengkun Cai +8Language Model Safety EvaluationMultimodal Large Language Models

  11. Agent Tools Orchestration Leaks More: Dataset, Benchmark, and Mitigation

    Dec 18, 2025Yuxuan Qiao, Dongqin Liu, Hongchang Yang +2LLM Agent SecurityLLM Agents

  12. Reasoning Up the Instruction Ladder for Controllable Language Models

    Oct 30, 2025Zishuo Zheng, Vidhisha Balachandran, Chan Young Park +2LLM Safety AlignmentInstruction Following

  13. Attention Misses Visual Risk: Risk-Adaptive Steering for Multimodal Safety Alignment

    Oct 15, 2025Jonghyun Park, Minhyuk Seo, Chaewon Yeo +1Multimodal RobustnessLLM Safety Alignment

  14. The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives

    Oct 7, 2025Matthieu Bou, Nyal Patel, Arjun Jagota +2Reinforcement LearningLLM Auditing

  15. Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection

    Aug 28, 2025Harethah Abu Shairah, Hasan Abed Al Kader Hammoud, George Turkiyyah +1LLM GuardrailsLLM Safety Alignment

  16. Context Misleads LLMs: The Role of Context Filtering in Maintaining Safe Alignment of LLMs

    Aug 9, 2025Jinhwa Kim, Ian G. HarrisLLM Safety AlignmentLLM Safety

  17. Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

    Jun 9, 2025Mickel Liu, Liwei Jiang, Yancheng Liang +4Self-Play RLAdversarial Attacks on LLMs

  18. Decoding One Safety Trigger Token for Balancing Safety and Usability in Large Language Models

    May 12, 2025Haoran Gu, Handing Wang, Yi Mei +2LLM Safety AlignmentLLM Safety

  19. Adaptive Helpfulness-Harmlessness Alignment with Preference Vectors

    Apr 27, 2025Ren-Wei Liang, Chin-Ting Hsu, Chan-Hung Yu +6LLM AlignmentLLM Safety Alignment

  20. Decoupled Alignment for Robust Plug-and-Play Adaptation

    Jun 3, 2024Haozheng Luo, Jiahao Yu, Wenxin Zhang +9LLM AlignmentLLM Safety Alignment

  21. Learning diverse attacks on large language models for robust red-teaming and safety tuning

    May 28, 2024Seanie Lee, Minsu Kim, Lynn Cherif +8Adversarial Attacks on LLMsLLM Red Teaming

  22. Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge

    Apr 8, 2024Weikai Lu, Ziqian Zeng, Jianwei Wang +5LLM Safety AlignmentLLM Jailbreak Attacks

  23. SaFeR-Steer: Evolving Multi-Turn MLLMs via Synthetic Bootstrapping and Feedback Dynamics

    Date pendingHaolong Hu, Hanyu Li, Tiancheng He +6Language Model SteeringMultimodal Large Language Models

  24. Norms at a Price: Why RL-Based Alignment Can Promise Conditional Compliance at Best

    Date pendingKevin Baum, Rūta Binkytė, Felix JahnAI AlignmentLLM Safety Alignment