Refusal Behavior in Language Models

Latest papers 93

All topics
CardsList
  1. How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense

    Oct 7, 2026Zhankai Ye, Yanning Wang, Yukai Jin +5Refusal Behavior in Language ModelsLLM Safety Alignment

  2. CompOrca: Corpus-Scale Compliance Labelling of Instruction-Tuning Data

    Sep 29, 2026Philipp E. Glass, Alina MironLLM AuditingInstruction Tuning

  3. Less Sycophancy, Stronger Refusal? Lessons for AI Safety from Mechanistic Interpretability

    Sep 28, 2026Xu Wang, Difan Zou, Xuansheng WuLLM SycophancyLanguage Model Safety Evaluation

  4. Tool Mediation Alters Refusal Mechanisms in Large Language Models

    Sep 28, 2026Abel Rodríguez, Giuseppe Garofalo, Lieven Desmet +1Language Model Safety EvaluationLLM Agent Safety

  5. The Role of Fine-grained Harm Signals in LLM Safety

    Sep 16, 2026Soyeon Park, Seogyeong Jeong, Sunwoo Kim +1LLM InterpretabilityLLM Safety

  6. First Token Matters: Understanding Safety Collapse in Large Reasoning Models

    Sep 16, 2026Yizheng Yang, Haining Yu, Yuechen Wang +4LLM Safety AlignmentInference-Time Intervention

  7. BLINDSPOT: A Benchmark for Safety and Refusal Calibration in Long-Horizon Tool-Using Agents

    Sep 14, 2026Sadia Asif, Mohammad Mohammadi Amiri, Momin Abbas +2Long-Horizon Agent EvaluationAI Agent Safety Benchmarks

  8. A Unified Mechanistic Analysis of Knowledge- and Safety-Based Refusals

    Sep 1, 2026Yuri Son, Seunghee Kim, Hyuhng Joon Kim +1LLM InterpretabilityLLM Refusal Behavior

  9. Beyond Token Positions: Safety Alignment Across Denoising Steps in Diffusion Language Models

    Aug 31, 2026Guoli Wang, Haonan Shi, Tu Ouyang +1Language Model Safety EvaluationDiffusion Language Model Decoding

  10. Controlling Refusal Behavior of LLMs via Stiefel-Constrained Rotation Steering

    Aug 31, 2026Kirill Bunin, Dmitry Bylinkin, Vladimir Aletov +3Language Model SteeringRefusal Behavior in Language Models

  11. The Fragility of Jailbreak Robustness Across Operational States

    Aug 31, 2026Yuna Park, Hwang Youn Kim, Yujin Kim +3Prompt SensitivityLanguage Model Safety Evaluation

  12. The Safety Relay in Roleplay Jailbreaks: A Component-Resolved Causal Analysis of Harm Recognition and Refusal

    Aug 31, 2026Md Mokarram Chowdhury, Ernie Chang, Yang LiJailbreak AttacksLLM Jailbreak Attacks

  13. ALTSTEER: Selective Safety Steering for Moving Beyond Hard Refusals to Constructive Alternatives

    Aug 31, 2026Hoejoon Kwon, Byeonggeuk Lim, Kahyeon Kim +1Language Model SteeringLLM Safety Alignment

  14. How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment

    Aug 12, 2026Guang Yang, Fengchen Liu, Alex Wang +2VLM EvaluationRefusal Behavior in Language Models

  15. Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models

    Aug 12, 2026Mingyu Zong, Sampad Mohanty, Bhaskar KrishnamachariLLM AlignmentLLM Interpretability

  16. TAF-MED: Multi-Turn Safety Refusal Collapse in LLMs Under Declared Self-Treatment Intent

    Aug 10, 2026Waleed Jamil, Raphael SchmittLLM Safety BenchmarksLLM Safety Evaluation

  17. BASIS: Breach-Aware Selective Prompt Injection Shielding with Prefill Attention Probes

    Aug 8, 2026Laiqiao Qin, Tianqing Zhu, Longxiang Gao +1Prompt Injection DefensePrompt Injection Attacks on LLMs

  18. Mood Matters: How Syntactic Sensitivity Undermines Safety Alignment

    Aug 5, 2026Alina Klerings, Jannik Brinkmann, Heiner Stuckenschmidt +1Adversarial Attacks on LLMsLLM Safety Alignment

  19. Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

    Aug 5, 2026Xuzheng Yang, Jun Ling, Tao Huang +2RL for Language ModelsGroup Relative Policy Optimization