LLM Refusal Behavior

LLM: Large Language Model

Momentum

1 paper in the last four weeks, down 86% on the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 53

All topics
CardsList
  1. EmoRSS: Mitigating Emotion-Induced Over-Refusal in Large Language Models

    Oct 4, 2026Shuyi Miao, Yaojin Ma, Chenhang Cui +5LLM AlignmentLLM Refusal Behavior

  2. Mitigating LLM Over-Refusal via Dynamic Semantic Routing Calibration

    Sep 6, 2026Zixuan Wang, Bingjie Zhang, He Zhao +1Mechanistic InterpretabilityLLM Refusal Behavior

  3. PACE: Towards Surfacing Hidden Conflicts in User Requests

    Sep 3, 2026Yoojin Kim, Jihyoung Jang, Hyounghun KimAI Agent SafetyLLM Refusal Behavior

  4. A Unified Mechanistic Analysis of Knowledge- and Safety-Based Refusals

    Sep 1, 2026Yuri Son, Seunghee Kim, Hyuhng Joon Kim +1LLM InterpretabilityLLM Refusal Behavior

  5. Refusing Intent, Not Form: Wrapper-Based Intent-Group Supervision for LLM Safety

    Aug 13, 2026Ping Wu, Haibo Tong, Feifei Zhao +7LLM Safety AlignmentLLM Refusal Behavior

  6. Capabilities of Claude Fable 5 on Biomedical Challenge Problems

    Jul 12, 2026Dominic Okonkwo, Magnus Hodgson, Temitope I. David +1Biomedical QALLM Refusal Behavior

  7. Evaluating calibrated refusal and safe usefulness in dual-use biology settings

    Jul 6, 2026Edwin H. Wintermute, Harmon Bhasin, Christina M. Agapakis +13LLM Refusal BehaviorSafety Filtering

  8. Refusal Lives Downstream of Persona in Chat Models

    Jun 24, 2026Viola Zhong, Qirui LiLanguage Model SteeringLLM Refusal Behavior

  9. Do Thinking Tokens Help with Safety?

    Jun 23, 2026Narutatsu Ri, Abhishek Panigrahi, Sanjeev AroraLLM Refusal BehaviorLLM Safety Evaluation

  10. LLMs Prompted for Legal Context Object More: Overrefusal from Small On-Premises LLMs in Criminal Legal Context

    Jun 23, 2026Anastasiia Kucherenko, François Brouchoud, Dimitri Percia David +1LLM PromptingSmall Language Models

  11. The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs

    Jun 21, 2026Shivam Ratnakar, Kartikeya VatsLanguage Model SteeringAdversarial Attacks on LLMs

  12. A Low-Rank Subspace Analysis of LLM Interventions

    Jun 12, 2026Angira Sharma, Christian Schroeder de Witt, Philip Torr +2LLM InterpretabilityLLM Refusal Behavior

  13. LoMC: Localized Multidirectional Correction for Refusal Suppression in Routed Foundation Models

    Jun 10, 2026Yan Hong, Kedong Xiu, Wei Li +6Mixture-of-Experts Language ModelsLLM Refusal Behavior

  14. PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models

    Jun 8, 2026Gianluca Barmina, Federico Torrielli, Sven Harms +7Emotional Support ConversationMental Health

  15. (Mis)generalization of Helpful-only Fine-tuning

    Jun 3, 2026Mohammad Omar Khursheed, Baram Sosis, Fabien RogerSupervised Fine-TuningLLM Sycophancy

  16. Expert-Aware Refusal Steering

    Jun 2, 2026Anna C. Marbut, Daniel R. Olson, Travis J. WheelerMixture-of-Experts Language ModelsLanguage Model Steering

  17. DDOR: Delta Debugging for Explainable Overrefusal Testing and Repair

    Jun 2, 2026Qinyan Zhou, Peixin Zhang, Jun Sun +2LLM GuardrailsLLM Refusal Behavior

  18. A New Framework for Cybersecurity Refusals in AI Agents

    May 31, 2026Eliot Krzysztof Jones, Mateusz Dziemian, Matt Fredrikson +1LLM Agent EvaluationLLM Refusal Behavior

  19. SciIntBench: Measuring LLM Compliance with Research Integrity Norms Under Adversarial Framing

    May 28, 2026Almene De Meran Meguimtsop, Maria Leonor Pacheco, Daniel E. AcunaAI for ScienceAdversarial Attacks on LLMs

  20. The Ethics of LLM Sandbox and Persona Dynamics

    May 27, 2026Tim Gebbie, Stewart GebbieLLM GuardrailsLLM Safety Alignment

  21. Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations

    May 27, 2026Matteo Gioele Collu, Riccardo Conte, Alberto Giaretta +4LLM InterpretabilityAdversarial Attacks on LLMs

  22. Beyond a Single Direction: Chain-of-Thought Disrupts Simple Steering of Refusal

    May 26, 2026Kia-Jüng Yang, Dominik Meier, Jiachen Zhao +2CoT ReasoningLLM Refusal Behavior

  23. Open-source LLMs administer maximum electric shocks in a Milgram-like obedience experiment

    May 20, 2026Roland Pihlakas, Jan Llenzl DagohoyLLM Refusal BehaviorLLM Safety Evaluation

  24. RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts

    May 20, 2026Lukas Weidener, Marko Brkić, Mihailo Jovanović +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  25. Residual Paving: Diagnosing the Routing Bottleneck in Selective Refusal Editing

    May 18, 2026Bryce Hinkley, Peyman NajafiradResidual LearningLLM Refusal Behavior

  26. LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs

    May 13, 2026Rodrigo Nogueira, Thales Sales Almeida, Giovana Kerche Bonás +7Adversarial Prompt GenerationLLM Guardrails

  27. The Refusal--Compliance Tradeoff: A Large-Scale Safety Behavior Audit of Large Language Models

    May 6, 2026Alif Al Hasan, Sumon BiswasLLM Safety BenchmarksLanguage Model Safety Evaluation

  28. Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection

    May 2, 2026Xulin Hu, Che Wang, Wei Yang Bryan Lim +2Adversarial Attacks on LLMsLLM Refusal Behavior

  29. Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding

    Apr 18, 2026Yupeng Qi, Ziyu Lyu, Lixin Cui +2Language Model Safety EvaluationLLM Refusal Behavior

  30. From Refusal Tokens to Refusal Control: Discovering and Steering Category-Specific Refusal Directions

    Mar 9, 2026Rishab Alagharu, Ishneet Sukhvinder Singh, Shaibi Shamsudeen +2Language Model SteeringLLM Refusal Behavior

  31. There Is More to Refusal in Large Language Models than a Single Direction

    Feb 2, 2026Faaiz Joad, Majd Hawasly, Sabri Boughorbel +2LLM InterpretabilityLLM Refusal Behavior

  32. LLMs Encode Harmfulness and Refusal Separately

    Jul 16, 2025Jiachen Zhao, Jing Huang, Zhengxuan Wu +2LLM InterpretabilityLLM Refusal Behavior

  33. Refusal Beyond a Single Direction: A Preliminary Comparison of Diff-in-Means and INLP

    Date pendingElisabetta Rocchetti, Alfio FerraraLLM Refusal BehaviorCausal Interventions in Language Models