LLM Refusal Behavior

LLM: Large Language Model

Momentum

1 paper in the last four weeks, down 86% on the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 54

All topics
CardsList
  1. EmoRSS: Mitigating Emotion-Induced Over-Refusal in Large Language Models

    Oct 4, 2026Shuyi Miao, Yaojin Ma, Chenhang Cui +5LLM AlignmentLLM Refusal Behavior

  2. Mitigating LLM Over-Refusal via Dynamic Semantic Routing Calibration

    Sep 6, 2026Zixuan Wang, Bingjie Zhang, He Zhao +1Mechanistic InterpretabilityLLM Refusal Behavior

  3. PACE: Towards Surfacing Hidden Conflicts in User Requests

    Sep 3, 2026Yoojin Kim, Jihyoung Jang, Hyounghun KimAI Agent SafetyLLM Refusal Behavior

  4. A Unified Mechanistic Analysis of Knowledge- and Safety-Based Refusals

    Sep 1, 2026Yuri Son, Seunghee Kim, Hyuhng Joon Kim +1LLM InterpretabilityLLM Refusal Behavior

  5. Refusing Intent, Not Form: Wrapper-Based Intent-Group Supervision for LLM Safety

    Aug 13, 2026Ping Wu, Haibo Tong, Feifei Zhao +7LLM Safety AlignmentLLM Refusal Behavior

  6. Capabilities of Claude Fable 5 on Biomedical Challenge Problems

    Jul 12, 2026Dominic Okonkwo, Magnus Hodgson, Temitope I. David +1Biomedical QALLM Refusal Behavior

  7. Evaluating calibrated refusal and safe usefulness in dual-use biology settings

    Jul 6, 2026Edwin H. Wintermute, Harmon Bhasin, Christina M. Agapakis +13LLM Refusal BehaviorSafety Filtering

  8. Refusal Lives Downstream of Persona in Chat Models

    Jun 24, 2026Viola Zhong, Qirui LiLanguage Model SteeringLLM Refusal Behavior

  9. Do Thinking Tokens Help with Safety?

    Jun 23, 2026Narutatsu Ri, Abhishek Panigrahi, Sanjeev AroraLLM Refusal BehaviorLLM Safety Evaluation

  10. LLMs Prompted for Legal Context Object More: Overrefusal from Small On-Premises LLMs in Criminal Legal Context

    Jun 23, 2026Anastasiia Kucherenko, François Brouchoud, Dimitri Percia David +1LLM PromptingSmall Language Models

  11. The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs

    Jun 21, 2026Shivam Ratnakar, Kartikeya VatsLanguage Model SteeringAdversarial Attacks on LLMs

  12. A Low-Rank Subspace Analysis of LLM Interventions

    Jun 12, 2026Angira Sharma, Christian Schroeder de Witt, Philip Torr +2LLM InterpretabilityLLM Refusal Behavior

  13. LoMC: Localized Multidirectional Correction for Refusal Suppression in Routed Foundation Models

    Jun 10, 2026Yan Hong, Kedong Xiu, Wei Li +6Mixture-of-Experts Language ModelsLLM Refusal Behavior

  14. PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models

    Jun 8, 2026Gianluca Barmina, Federico Torrielli, Sven Harms +7Emotional Support ConversationMental Health

  15. (Mis)generalization of Helpful-only Fine-tuning

    Jun 3, 2026Mohammad Omar Khursheed, Baram Sosis, Fabien RogerSupervised Fine-TuningLLM Sycophancy

  16. Expert-Aware Refusal Steering

    Jun 2, 2026Anna C. Marbut, Daniel R. Olson, Travis J. WheelerMixture-of-Experts Language ModelsLanguage Model Steering

  17. DDOR: Delta Debugging for Explainable Overrefusal Testing and Repair

    Jun 2, 2026Qinyan Zhou, Peixin Zhang, Jun Sun +2LLM GuardrailsLLM Refusal Behavior

  18. A New Framework for Cybersecurity Refusals in AI Agents

    May 31, 2026Eliot Krzysztof Jones, Mateusz Dziemian, Matt Fredrikson +1LLM Agent EvaluationLLM Refusal Behavior