LLM Safety Alignment

LLM: Large Language Model

Momentum

25 papers in the last four weeks, up 14% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 236

All topics
CardsList
  1. SafeMed-R1: Clinician-Audited Safety and Ethics Alignment for Medical Large Language Models

    May 27, 2026Chao Ding, Mouxiao Bian, Tianbin Li +12HealthcareLLM Auditing

  2. SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection

    May 27, 2026Shuhao Chen, Weisen Jiang, Yeqi Gong +5LLM Fine-TuningLLM Safety Alignment

  3. Position: AI Safety Requires Effective Controllability

    May 26, 2026Yige Li, Yunhao Feng, Jun SunLLM Safety AlignmentAI Agent Safety

  4. When Medical Safety Alignment Fails: A Benchmark for Evaluating LLMs on High-Risk Medical Queries

    May 26, 2026Yige Li, Jun Sun, Wei Zhao +5LLM Safety BenchmarksHealthcare

  5. Algorithmic Fragility and Persona Bias in LLM-Generated Autistic Communication

    May 26, 2026Naba Rizvi, Mohammed Rizvi, Harper Strickland +2Autism Spectrum DisorderSocial Bias in Language Models

  6. Curriculum Learning for Safety Alignment

    May 25, 2026Sandeep Kumar, Virginia Smith, Chhavi YadavLLM AlignmentDirect Preference Optimization

  7. SafeCtrl-RL: Inference-Time Adaptive Behaviour Control for LLM Dialogue via RL-Driven Prompt Optimisation

    May 25, 2026Michael Orme, Yanchao Yu, Zhiyuan TanRL for Language ModelsLanguage Model-Based Control

  8. Jailbreak to Protect: Buffering and Reinforcing via Temporary Jailbreaking for Safe Fine-Tuning in Large Language Models

    May 23, 2026Seokil Ham, Jaehyuk Jang, Wonjun Lee +1LLM Fine-TuningLLM Safety Alignment

  9. JT-SAFE-V2: Safety-by-Design Foundation Model with World-Context Data

    May 23, 2026Junlan Feng, Fanyu Meng, Chong Long +12LLM Safety AlignmentLLM Safety

  10. Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs

    May 22, 2026Qitao Tan, Xiaoying Song, Arman Akbari +7LLM Safety AlignmentRefusal Behavior in Language Models

  11. CR4T: Rewrite-Based Guardrails for Adolescent LLM Safety

    May 20, 2026Heajun An, Qi Zhang, Vedanth Achanta +1LLM GuardrailsLLM Safety Alignment

  12. Towards Context-Invariant Safety Alignment for Large Language Models

    May 20, 2026Yixu Wang, Yang Yao, Xin Wang +4RL for Language ModelsLLM Alignment

  13. Alignment Dynamics in LLM Fine-Tuning

    May 18, 2026Yuhan Huang, Huanran Chen, Yinpeng DongLLM AlignmentLLM Fine-Tuning

  14. Propagating Unsafe Actions in LLM Controlled Multi-Robot Collaboration via Single Robot Compromise

    May 15, 2026Zhen Huang, Zhihuang Liu, Mengxuan Luo +2Large Language Model-Based Robot PlanningAdversarial Attacks on LLMs

  15. Reducing the Safety Tax in LLM Safety Alignment with On-Policy Self-Distillation

    May 14, 2026Yu Fu, Longxuan Yu, Haz Sameen Shahgir +4LLM AlignmentOn-Policy Self-Distillation

  16. GradShield: Alignment Preserving Finetuning

    May 13, 2026Zhanhao Hu, Xiao Huang, Patrick Mendoza +4LLM Fine-TuningLLM Safety Alignment

  17. BSO: Safety Alignment Is Density Ratio Matching

    May 12, 2026Tien-Phat Nguyen, Truong Nguyen, Thin Nguyen +3Functional Bregman DivergencesDirect Preference Optimization

  18. On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment

    May 12, 2026Bo Yin, Qi Li, Xinchao WangAgentic RLLLM Safety Alignment

  19. SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models

    May 12, 2026Xinyi Zeng, Xue Yang, Jingyuan Zhang +5Adversarial Attacks on VLMsMultimodal Robustness

  20. Toward Stable Value Alignment: Introducing Independent Modules for Consistent Value Guidance

    May 12, 2026Wenhao Chen, Sirui Sun, Shengyuan Bai +1LLM AlignmentLLM Safety Alignment

  21. Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion

    May 12, 2026ShiYing Huang, Liang Lin, Yuer Li +6LLM Safety AlignmentMulti-Objective Language Model Alignment

  22. Intrinsic Guardrails: How Semantic Geometry of Personality Interacts with Emergent Misalignment in LLMs

    May 11, 2026Krishak Aneja, Manas Mittal, Anmol Goel +2LLM AlignmentLLM Interpretability

  23. Internalizing Safety Understanding in Large Reasoning Models via Verification

    May 9, 2026Yi Zhang, Yuxin Chen, Leheng Sheng +4LLM Safety AlignmentLLM Safety

  24. A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models

    May 8, 2026Hamid Kazemi, Atoosa Chegini, Maria SafiLLM InterpretabilityAdversarial Attacks on LLMs