LLM Safety

LLM: Large Language Model

Momentum

36 papers in the last four weeks, up 200% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 272

All topics
CardsList
  1. Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering

    May 7, 2026Xiaomin Li, Jianheng Hou, Zheyuan Deng +6LLM SafetyLLM Safety Evaluation

  2. One Turn Too Late: Learning When to Intervene Against Multi-Turn Malicious Intent

    May 7, 2026Xinjie Shen, Rongzhe Wei, Peizhi Niu +6Language Model Safety EvaluationLLM Guardrails

  3. The Refusal--Compliance Tradeoff: A Large-Scale Safety Behavior Audit of Large Language Models

    May 6, 2026Alif Al Hasan, Sumon BiswasLLM Safety BenchmarksLanguage Model Safety Evaluation

  4. Understanding Annotator Safety Policy with Interpretability

    May 6, 2026Alex Oesterling, Donghao Ren, Yannick Assogba +4Annotator DisagreementHuman-in-the-Loop Annotation

  5. From Parameter Dynamics to Risk Scoring : Quantifying Sample-Level Safety Degradation in LLM Fine-tuning

    May 6, 2026Xiao Wang, Yifei Zhang, YongKang Liu +4LLM Fine-TuningLLM Safety

  6. Reducing Conversational Escalation in Large Language Model Dialogue with Nonviolent Communication Constraints

    May 1, 2026Zhixing Sun, Shenghe Xu, Tao LiLLM PromptingLLM Safety

  7. FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios

    May 1, 2026Yutao Hou, Yihan Jiang, Yuhan Xie +5Multilingual Language Model EvaluationLanguage Model Safety Evaluation

  8. Exploration Hacking: Can LLMs Learn to Resist RL Training?

    Apr 30, 2026Eyon Jang, Damon Falck, Joschka Braun +6RL ExplorationLLM Safety

  9. Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations

    Apr 29, 2026Mingqian Zheng, Malia Morgan, Liwei Jiang +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  10. Dynamic Adversarial Fine-Tuning Reorganizes Refusal Geometry

    Apr 29, 2026Wenhao Lan, Shan Li, Xinhua Lai +4Adversarial TrainingLanguage Model Safety Evaluation

  11. Jailbreaking Frontier Foundation Models Through Intention Deception

    Apr 27, 2026Xinhe Wang, Katia Sycara, Yaqi XieJailbreak AttacksLLM Safety

  12. How Large Language Models Balance Internal Knowledge with User and Document Assertions

    Apr 24, 2026Shuowei Li, Haoxin Li, Wenda Chu +1LLM SycophancyKnowledge Augmentation for Language Models

  13. Removing Sandbagging in LLMs by Training with Weak Supervision

    Apr 23, 2026Emil Ryd, Henning Bartsch, Julian Stastny +2LLM Safety

  14. Detoxification for LLM: From Dataset Itself

    Apr 21, 2026Wei Shao, Yihang Wang, Gaoyu Zhu +4Training Data CurationLLM Safety

  15. LLM Safety From Within: Detecting Harmful Content with Internal Representations

    Apr 20, 2026Difan Jiao, Yilun Liu, Ye Yuan +4Language Model Safety EvaluationLLM Guardrails

  16. Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks

    Apr 20, 2026Md Rysul Kabir, Zoran TiganjLanguage Model Safety EvaluationLLM Interpretability

  17. Reverse Constitutional AI: A Framework for Controllable Toxic Data Generation via Probability-Clamped RLAIF

    Apr 20, 2026Yuan Fang, Yiming Luo, Aimin Zhou +1Language Model Safety EvaluationAdversarial Scenario Generation

  18. RoTRAG: Rule of Thumb Reasoning for Conversation Harm Detection with Retrieval-Augmented Generation

    Apr 19, 2026Juhyeon Lee, Wonduk Seo, Junseo Koh +3Retrieval-Augmented GenerationToxicity Detection

  19. Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding

    Apr 18, 2026Yupeng Qi, Ziyu Lyu, Lixin Cui +2Language Model Safety EvaluationLLM Refusal Behavior

  20. Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs

    Apr 17, 2026Jaechul Roh, Virat Shejwalkar, Amir HoumansadrLanguage Model Safety EvaluationLLM Fine-Tuning

  21. A Systematic Study of Training-Free Methods for Trustworthy Large Language Models

    Apr 17, 2026Wai Man Si, Mingjie Li, Michael Backes +1LLM AlignmentLLM Safety

  22. Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs

    Apr 17, 2026Wai Man Si, Mingjie Li, Michael Backes +1LLM PruningLLM Safety Alignment