LLM Safety

LLM: Large Language Model

Momentum

36 papers in the last four weeks, up 200% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 272

All topics
CardsList
  1. SLDR: Defending Against Malicious Fine-tuning via Selective Layers Recovery and Dynamic Routing

    Oct 7, 2026Hui Zhang, Yachao Yuan, Jiayun Wang +3LLM SecurityLLM Safety

  2. Reading, Not Manipulating: Leveraging Router Logits for Multimodal Safety in MoE Vision-Language Models

    Oct 6, 2026Ziyuan Yang, Wenxuan Ding, Shangbin Feng +1Vision-Language ModelsSafety Filtering

  3. Safeguarding LLMs via Model-Agnostic Latent Safety Signals from Dark Knowledge

    Oct 5, 2026Wonjun Lee, Kyungsik Yang, Gaeun Ji +5Adversarial Attacks on LLMsLLM Security

  4. Harmful SFT Leaves a Continuous Trace in LLM Checkpoint Updates

    Oct 5, 2026Ziqun Bao, Xinyu Zhang, Yuchen Shao +1LLM AuditingLLM Safety

  5. Jailbreaking Open-Weight LLMs via Random Embedding Perturbations

    Oct 5, 2026Abhinav Sudhakar Dubey, Scott Sirri, Vaggos Chatziafratis +1Adversarial AttacksAdversarial Attacks on LLMs

  6. TrustMI: Causally controlling how assistants trust their users

    Oct 5, 2026Théo Lasnier, Romain Froger, Maxence Lasbordes +1LLM SafetyTrust in AI

  7. Reflections and Fragments: Securing LLMs Against Sequential Mosaic Attacks

    Oct 4, 2026Emanuele La Malfa, Saar Cohen, Gabriele La Malfa +4Adversarial Attacks on LLMsLLM Safety

  8. FORGE: Verification-Gated Behavioral Repair for Generative Language Models

    Oct 4, 2026Hsin-Ling Hsu, Min-Yu Chen, Nai-Chia Chen +3Social Bias in Language ModelsLLM Safety

  9. MOMAT: Mixture of Multiple Atlases for Low-Power Jailbreak Defense of Quantized LLMs

    Oct 1, 2026Boyang Li, Bingyu Shen, Weihao Hong +6Retrieval-Augmented GenerationLLM Safety

  10. Preemptive LLM Unlearning against Forbidden Capability Acquisition via Gradient Sealing

    Sep 30, 2026Kemou Li, Qizhou Wang, Yue Wang +6LLM SecurityLLM Safety

  11. MASCRDM: Multi-Agent System for Compliance Risk Detection and Mitigation in Training Process of Large Language Models

    Sep 30, 2026Yan Zhang, Chuming Wei, Ruien Li +3LLM SafetyLanguage Model Bias Evaluation

  12. ThinkingGuard: Decoding Implicit Hazards via Step-by-Step Risk Attribution in Multimodal Large Language Models

    Sep 29, 2026Ruochen Zhang, Yao Huang, Yitong Sun +5Multimodal ReasoningLLM Safety

  13. The Safety Operator: Modulating the Expression of Safety Instructions via Spectral Optimization

    Sep 29, 2026Benoit Dherin, Michael Munn, Xavier Gonzalvo +14LLM Safety AlignmentLLM Safety

  14. Right Words, Wrong Moment: A Clinician-Grounded Analysis of Distress in 19,930 Conversations between Young People and ChatGPT

    Sep 28, 2026Marx Wang, Ella Zhang, Cameron Tan +11Emotional Support ConversationHuman-AI Interaction

  15. When Do Model Internals Help? Exploring the Role of Representation Engineering in LLM Safety

    Sep 28, 2026Tianyi Guan, Jianhui Chen, Liangming PanLanguage Model Safety EvaluationLLM Interpretability

  16. How to Tame a Multi-Headed Hydra? Adaptive Multi-Category Safety Steering for Large Language Models

    Sep 28, 2026Chenxi Wang, Ruiyang Huang, Li Huang +1Language Model SteeringLLM Safety

  17. AdaGuard: An Adaptive Guard Model with User-defined Policies

    Sep 28, 2026Yunhao Feng, Yifan Ding, Yuxiang Xie +4LLM GuardrailsAI Agent Safety

  18. Quantifying Behavioral Tails in Black-Box Language Models

    Sep 27, 2026Elsayed Eshra, Ali Al-Lawati, Dongwon Lee +1Language Model Safety EvaluationLLM Safety

  19. Beyond Average Safety: Chance-Constrained LLM Fine-tuning

    Sep 24, 2026Taha Entesari, Mahyar FazlyabStochastic OptimizationChance-Constrained Optimization

  20. Rare Event Estimation via Iterative Unalignment

    Sep 21, 2026Hanming Yang, Daksh Mittal, Jing Dong +1Importance SamplingLLM Safety

  21. Local Sparsity Enables Unsupervised LLM Safety Detection

    Sep 17, 2026Xin Chen, Gil Kur, Alexander Shevchenko +1Sparse AutoencodersLLM Safety

  22. Safety Beyond the Interface: Detecting Harm via Latent States in Large Language Models

    Sep 16, 2026Alizishaan Khatri, Chiquita Prabhu, Omkar NeogiSafety FilteringLLM Safety