LLM Safety

LLM: Large Language Model

Momentum

36 papers in the last four weeks, up 200% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 272

All topics
CardsList
  1. Geometry-Lite: Interpretable Safety Probing via Layer-Wise Margin Geometry

    May 18, 2026Woo Seob Sim, Yu Rang ParkLanguage Model Safety EvaluationLLM Safety

  2. New Wide-Net-Casting Jailbreak Attacks Risk Large Models

    May 16, 2026Qiuchi Xiang, Haoxuan Qu, Hossein Rahmani +1Language Model Safety EvaluationJailbreak Attacks

  3. Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning

    May 16, 2026Puning Yang, Junchi Yu, Qizhou Wang +3LLM RefusalLLM Safety

  4. Quantifying and Mitigating Premature Closure in Frontier LLMs

    May 14, 2026Rebecca Handler, Suhana Bedi, Nigam ShahHealthcareLLM Prompting

  5. Selective Safety Steering via Value-Filtered Decoding

    May 14, 2026Bat-Sheva Einbinder, Hen Davidov, Yee Whye Teh +2Language Model DecodingLanguage Model Steering

  6. Mechanical Enforcement for LLM Governance:Evidence of Governance-Task Decoupling in Financial Decision Systems

    May 14, 2026José Manuel de la Chica Rodríguez, Carlos Martí-GonzálezLLM AuditingLLM Safety

  7. A Few Steps Further: Why Defenses Against Malicious Finetuning Erode Under Continued Training

    May 14, 2026Itay Zloczower, Eyal Lenga, Gilad Gressel +1Language Model Safety EvaluationAdversarial Attacks on LLMs

  8. Fusion-fission forecasts when AI will shift to undesirable behavior

    May 14, 2026Neil F. Johnson, Frank Yingjie HuoAI Safety EvaluationLLM Safety

  9. GradShield: Alignment Preserving Finetuning

    May 13, 2026Zhanhao Hu, Xiao Huang, Patrick Mendoza +4LLM Fine-TuningLLM Safety Alignment

  10. Negation Neglect: When models fail to learn negations in training

    May 13, 2026Harry Mayne, Lev McKinney, Jan Dubiński +3LLM ReliabilityLLM Safety

  11. Model-Agnostic Lifelong LLM Safety via Externalized Attack-Defense Co-Evolution

    May 13, 2026Xiaozhe Zhang, Chaozhuo Li, Hui Liu +4Continual Learning for LLMsAdversarial Attacks on LLMs

  12. Adaptive Steering and Remasking for Safe Generation in Diffusion Language Models

    May 13, 2026Yejin Lee, Ungsik Kim, Yo-Sub HanAdversarial Attacks on LLMsDiffusion Language Model Inference

  13. Targeted Neuron Modulation via Contrastive Pair Search

    May 12, 2026Sam Herring, Jake Naviasky, Karan MalhotraLanguage Model SteeringLLM Interpretability

  14. Metaphor Is Not All Attention Needs

    May 12, 2026Olga Sorokoletova, Francesco Giarrusso, Giacomo De Luca +6Adversarial Attacks on LLMsJailbreak Attacks

  15. SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models

    May 12, 2026Xinyi Zeng, Xue Yang, Jingyuan Zhang +5Adversarial Attacks on VLMsMultimodal Robustness

  16. Guaranteed Jailbreaking Defense via Disrupt-and-Rectify Smoothing

    May 11, 2026Zheng Lin, Zhenxing Niu, Haoxuan Ji +1Randomized SmoothingJailbreak Robustness

  17. GuardAD: Safeguarding Autonomous Driving MLLMs via Markovian Safety Logic

    May 11, 2026Tianyuan Zhang, Peng Yue, Zihao Peng +8Autonomous DrivingLLM Safety

  18. Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization

    May 11, 2026Huilin Zhou, Jian Zhao, Yilu Zhong +7Inference-Time OptimizationAdversarial Attacks on LLMs

  19. Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs

    May 9, 2026Sangyeon Yoon, Wonje Jeung, Yoonjun Cho +2Direct Preference OptimizationLLM Fine-Tuning

  20. Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories

    May 9, 2026Dongcheng Zhang, Yi Zhang, Yuxin Chen +3LLM Self-CorrectionRL for Language Model Reasoning

  21. Internalizing Safety Understanding in Large Reasoning Models via Verification

    May 9, 2026Yi Zhang, Yuxin Chen, Leheng Sheng +4LLM Safety AlignmentLLM Safety

  22. LLM-Agnostic Semantic Representation Attack

    May 9, 2026Jiawei Lian, Jianhong Pan, Lefan Wang +4Adversarial Prompt GenerationAdversarial Attacks on LLMs

  23. Why Do Aligned LLMs Remain Jailbreakable: Refusal-Escape Directions, Operator-Level Sources, and Safety-Utility Trade-off

    May 9, 2026Yu Chen, Yuanhao Liu, Qi CaoLLM AlignmentLanguage Model Steering

  24. GLiGuard: Schema-Conditioned Classification for LLM Safeguard

    May 8, 2026Urchade Zaratiana, Mary Newhauser, George Hurn-Maloney +1LLM GuardrailsText Classification

  25. LLM Wardens: Mitigating Adversarial Persuasion with Third-Party Conversational Oversight

    May 8, 2026Lennart Wachowiak, Scott D. Blain, David Williams-King +1LLM GuardrailsLLM Safety

  26. How Value Induction Reshapes LLM Behaviour

    May 8, 2026Arnav Arora, Natalie Schluter, Katherine Metcalf +1LLM SycophancyLLM Alignment

  27. Mitigating Many-shot Jailbreak Attacks with One Single Demonstration

    May 8, 2026Kejia Chen, Jiawen Zhang, Boheng Li +6Jailbreak AttacksIn-Context Learning

  28. Behavior Cue Reasoning: Monitorable Reasoning Improves Efficiency and Safety through Oversight

    May 7, 2026Christopher Z. Cui, Taylor W. Killian, Prithviraj AmmanabroluScalable OversightLLM Safety

  29. Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks

    May 7, 2026Guoxin Lu, Letian Sha, Qing Wang +4LLM Fine-TuningLLM Safety Alignment