Refusal Behavior in Language Models

Latest papers 93

All topics
CardsList
  1. Code as a Weapon: A Consensus-Labeled Prompt Bank for Measuring Coding-Model Compliance with Malicious-Code Requests

    May 27, 2026Richard J. Young, Gregory D. MoodyClassificationLLM Safety Evaluation

  2. Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations

    May 27, 2026Matteo Gioele Collu, Riccardo Conte, Alberto Giaretta +4LLM InterpretabilityAdversarial Attacks on LLMs

  3. Beyond a Single Direction: Chain-of-Thought Disrupts Simple Steering of Refusal

    May 26, 2026Kia-Jüng Yang, Dominik Meier, Jiachen Zhao +2CoT ReasoningLLM Refusal Behavior

  4. Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs

    May 22, 2026Qitao Tan, Xiaoying Song, Arman Akbari +7LLM Safety AlignmentRefusal Behavior in Language Models

  5. Latent-space Attacks for Refusal Evasion in Language Models

    May 20, 2026Giorgio Piras, Raffaele Mura, Fabio Brau +4Adversarial Attacks on LLMsLLM Safety

  6. RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts

    May 20, 2026Lukas Weidener, Marko Brkić, Mihailo Jovanović +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  7. Targeted Neuron Modulation via Contrastive Pair Search

    May 12, 2026Sam Herring, Jake Naviasky, Karan MalhotraLanguage Model SteeringLLM Interpretability

  8. Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs

    May 9, 2026Sangyeon Yoon, Wonje Jeung, Yoonjun Cho +2Direct Preference OptimizationLLM Fine-Tuning

  9. Why Do Aligned LLMs Remain Jailbreakable: Refusal-Escape Directions, Operator-Level Sources, and Safety-Utility Trade-off

    May 9, 2026Yu Chen, Yuanhao Liu, Qi CaoLLM AlignmentLanguage Model Steering

  10. A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models

    May 8, 2026Hamid Kazemi, Atoosa Chegini, Maria SafiLLM InterpretabilityAdversarial Attacks on LLMs

  11. The Refusal--Compliance Tradeoff: A Large-Scale Safety Behavior Audit of Large Language Models

    May 6, 2026Alif Al Hasan, Sumon BiswasLLM Safety BenchmarksLanguage Model Safety Evaluation

  12. Self-Mined Hardness for Safety Fine-Tuning

    May 4, 2026Prakhar Gupta, Garv Shah, Donghua ZhangHard Negative MiningLLM Fine-Tuning

  13. Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection

    May 2, 2026Xulin Hu, Che Wang, Wei Yang Bryan Lim +2Adversarial Attacks on LLMsLLM Refusal Behavior

  14. Geometry-Calibrated Conformal Abstention for Language Models

    Apr 30, 2026Rui Xu, Yi Chen, Sihong Xie +1Uncertainty QuantificationSelective Prediction

  15. Dynamic Adversarial Fine-Tuning Reorganizes Refusal Geometry

    Apr 29, 2026Wenhao Lan, Shan Li, Xinhua Lai +4Adversarial TrainingLanguage Model Safety Evaluation

  16. Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks

    Apr 20, 2026Md Rysul Kabir, Zoran TiganjLanguage Model Safety EvaluationLLM Interpretability

  17. Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding

    Apr 18, 2026Yupeng Qi, Ziyu Lyu, Lixin Cui +2Language Model Safety EvaluationLLM Refusal Behavior

  18. When Choices Become Risks: Safety Failures of Large Language Models under Multiple-Choice Constraints

    Apr 18, 2026Yuheng Chen, Zhiyu Wu, Bowen Cheng +2Adversarial Attacks on LLMsLLM Safety Alignment

  19. What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal

    Apr 9, 2026Stephen Cheng, Sarah Wiegreffe, Dinesh ManochaLanguage Model SteeringLLM Interpretability

  20. From Refusal Tokens to Refusal Control: Discovering and Steering Category-Specific Refusal Directions

    Mar 9, 2026Rishab Alagharu, Ishneet Sukhvinder Singh, Shaibi Shamsudeen +2Language Model SteeringLLM Refusal Behavior

  21. There Is More to Refusal in Large Language Models than a Single Direction

    Feb 2, 2026Faaiz Joad, Majd Hawasly, Sabri Boughorbel +2LLM InterpretabilityLLM Refusal Behavior

  22. Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation

    Nov 14, 2025Mohamad Amin Mohamadi, Tianhao Wang, Zhiyuan LiRL for Language ModelsLLM Hallucination Mitigation