LLM Safety Alignment

LLM: Large Language Model

Momentum

25 papers in the last four weeks, up 14% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 236

All topics
CardsList
  1. Aligned in Form, Not in Meaning: The Comprehension - Containment Decoupling of LLM Safety in Low-Resource Bangla Derogatory Speech

    Aug 3, 2026Shadab Bin Habib, A K M Ferdous Reza Habib, Subarno Neel +1Language Model Safety EvaluationLLM Safety Alignment

  2. No Single Neuron of Failure: Distributed Safety Alignment Against White-Box Attacks

    Aug 2, 2026Simiao Xie, Chuancheng Shi, Shangze Li +5LLM AlignmentAdversarial Attacks on LLMs

  3. Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks

    Aug 2, 2026Shangze Li, Chuancheng Shi, Simiao Xie +6Adversarial Attacks on LLMsLLM Safety Alignment

  4. SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs

    Jul 31, 2026Jian Yu, Fei Shen, Cong Wang +5Multimodal RobustnessMultimodal Large Language Models

  5. One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs

    Jul 30, 2026Enyi Shi, Fei Shen, Chuancheng Shi +4VLM RobustnessMultimodal Large Language Models

  6. On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment

    Jul 29, 2026Yongjian Guo, Wanlun Ma, Lingyu Shen +2LLM Safety AlignmentAdversarial Robustness of Language Models

  7. Constitutional Midtraining: Content Presence Drives Alignment Gains

    Jul 29, 2026Desiree Cho, Cameron Tice, Bernie Hogan +4LLM AlignmentLLM Safety Alignment

  8. Steering Instruction Hierarchies at Inference Time

    Jul 28, 2026Siqi Zeng, Sewoong Lee, Han Zhao +1Language Model SteeringLLM Safety Alignment

  9. Beyond a Global Norm: Personalizing Toxicity Sensitivity in Language Models Without Retraining

    Jul 25, 2026Rares A. C. Diaconescu, Iulia Slanina, Alina Florea +5LLM AlignmentLLM Safety Alignment

  10. Distribution-Specific Curvature Control with Finite-Sample Guarantees for Open-Weight Safety

    Jul 24, 2026Domenic Rosati, Ali Dadsetan, Hong Huang +5Adversarial RobustnessLLM Safety Alignment

  11. Beyond Shapley: An Influence-Based Data Auditing Pipeline for LLM Alignment and Evaluation

    Jul 24, 2026Yunting Song, Matthew Watson, Peter Grabowski +1LLM Safety BenchmarksLLM Auditing

  12. V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure

    Jul 23, 2026Zhetong Zhang, Honghao Fu, Miao Xu +2VLM EvaluationVLM Robustness

  13. OPIUM: Mitigating Steering Externalities and Over-Refusal via Dual Objective Latent Optimization

    Jul 22, 2026Kavin Aravindan, Arihant Rastogi, Krishak Aneja +4LLM Safety AlignmentOver-Refusal

  14. TD-DPO: Difference-Aware Preference Optimization for Mitigating Sycophancy in Clinical Autism Intervention Dialogue

    Jul 17, 2026Shuzhong Lai, Junhong Lai, Chenxi Li +5LLM SycophancyDirect Preference Optimization

  15. Protective Capacity Hallucination: When Large Language Models Claim Nonexistent Capabilities

    Jul 15, 2026Eunna Lee, Jungpyo Nam, Sunjun HwangLanguage Model Safety EvaluationHallucination in Language Models

  16. HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models

    Jul 13, 2026Aznaur Aliev, Carlos Hinojosa, Abdelrahman Eldesokey +3LLM Fine-TuningLLM Safety Alignment

  17. Efficient Safety Alignment of Language Models via Latent Personality Traits

    Jul 8, 2026Mohamed Amine Merzouk, Nolan Smyth, Damiano Fornasiere +3Adversarial TrainingLLM Safety Alignment

  18. Functional and Secure Code Generation with Task Vectors

    Jul 8, 2026Felix Wang, Anudeep Das, Mei Nagappan +1Code GenerationLLM Safety Alignment

  19. Pretraining Curricula Enable Selective Fine-tuning

    Jul 6, 2026Sebastian A. Bruijns, Jirko Rubruck, Mia H. Whitefield +3Disentangled Representation LearningFine-Tuning

  20. Best-of-Better-NN: Generating Pre-Aligned Responses with In-Context Learning

    Jul 3, 2026Eric Lei, Hsiang Hsu, Chun-Fu ChenLLM AlignmentBest-of-N Sampling

  21. Safe Inference-Time Alignment via Lagrangian Reward Augmentation

    Jul 2, 2026Yaswanth Chittepu, Ativ Joshi, Sohini Chintala +1LLM AlignmentLLM Safety Alignment

  22. OpenSafeIntent: Evaluating Intent-Calibrated Safe Completion Across Dual-Use Prompt Sets

    Jul 2, 2026Rheeya Uppaal, Seungwoo Lyu, Selina Sung +1LLM Safety BenchmarksLanguage Model Safety Evaluation

  23. Safety Targeted Embedding Exploit via Refinement

    Jul 2, 2026Joshua Adrian CahyonoMultilingual Language Model EvaluationAdversarial Attacks on LLMs