Refusal Behavior in Language Models

Latest papers 93

All topics
CardsList
  1. When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models

    Aug 4, 2026Yu Feng, Chunting Zang, Chen Shen +4Language Model Safety EvaluationLLM Guardrails

  2. Aligned in Form, Not in Meaning: The Comprehension - Containment Decoupling of LLM Safety in Low-Resource Bangla Derogatory Speech

    Aug 3, 2026Shadab Bin Habib, A K M Ferdous Reza Habib, Subarno Neel +1Language Model Safety EvaluationLLM Safety Alignment

  3. HopRefusalBench: Diagnosing Refusal Failures in Search-Augmented Agents for Multi-Hop Reasoning

    Aug 2, 2026Jianan Xie, Xin Sun, Zhongqi Chen +3Multi-Hop QAAI Agent Benchmarks

  4. Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning

    Jul 31, 2026Xinyan Guan, Jiali Zeng, Chunlei Xin +5Overthinking in Language ModelsRL for Language Model Reasoning

  5. When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs

    Jul 27, 2026Tong Zhang, Zexin Li, Simin Chen +1LLM Inference EfficiencyLanguage Model Safety Evaluation

  6. Asymmetric Collapse in Model Merging: When Refusal Over- writes Recognition

    Jul 26, 2026Aarnav Choudhary, Matheus Fonseca Rocha, Jiwon Seo +2Language Model Safety EvaluationTask Vector Merging

  7. Do LLMs Know Their Vulnerable Scenarios?

    Jul 26, 2026Ziheng Peng, Huiqi Deng, Haoran Jing +5LLM InterpretabilityAdversarial Scenario Generation

  8. Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs

    Jul 21, 2026Seunghyun Lee, Dongyoon Han, Sangdoo YunLLM AlignmentLLM Refusal

  9. Capabilities of Claude Fable 5 on Biomedical Challenge Problems

    Jul 12, 2026Dominic Okonkwo, Magnus Hodgson, Temitope I. David +1Biomedical QALLM Refusal Behavior

  10. Faithfulness to Refusal: A Causal Audit of Neuron Selectors

    Jul 6, 2026Ananth Eswar, Pratinav Seth, Utsav Avaiya +1Transformer InterpretabilityFeature Attribution

  11. Fast Multi-dimensional Refusal Subspaces via RFM-AGOP

    Jul 2, 2026Thomas WinningerLLM InterpretabilityLLM Safety

  12. Addressing Over-Refusal in LLMs with Competing Rewards

    Jun 30, 2026Taeyoun Kim, Aviral KumarRL for Language Model ReasoningLLM Safety

  13. RAS: Measuring LLM Safety Through Refusal Alignment

    Jun 24, 2026Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu +1LLM Safety AlignmentLLM Safety

  14. Refusal Lives Downstream of Persona in Chat Models

    Jun 24, 2026Viola Zhong, Qirui LiLanguage Model SteeringLLM Refusal Behavior

  15. LLMs Prompted for Legal Context Object More: Overrefusal from Small On-Premises LLMs in Criminal Legal Context

    Jun 23, 2026Anastasiia Kucherenko, François Brouchoud, Dimitri Percia David +1LLM PromptingSmall Language Models

  16. Skin-Deep: A Geometric Diagnostic for Alignment Fragility in Large Language Model Representations

    Jun 21, 2026Dongyub Jude Lee, Jungseob Lee, Seungyoon Lee +5LLM InterpretabilityLLM Fine-Tuning

  17. LoMC: Localized Multidirectional Correction for Refusal Suppression in Routed Foundation Models

    Jun 10, 2026Yan Hong, Kedong Xiu, Wei Li +6Mixture-of-Experts Language ModelsLLM Refusal Behavior

  18. PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models

    Jun 8, 2026Gianluca Barmina, Federico Torrielli, Sven Harms +7Emotional Support ConversationMental Health

  19. Expert-Aware Refusal Steering

    Jun 2, 2026Anna C. Marbut, Daniel R. Olson, Travis J. WheelerMixture-of-Experts Language ModelsLanguage Model Steering

  20. DDOR: Delta Debugging for Explainable Overrefusal Testing and Repair

    Jun 2, 2026Qinyan Zhou, Peixin Zhang, Jun Sun +2LLM GuardrailsLLM Refusal Behavior

  21. TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages

    May 31, 2026Victor Akinode, Senyu Li, Wassim Hamidouche +3LLM Safety BenchmarksMultilingual Language Model Evaluation

  22. Low-Resource Safety Failures Are Action Failures, Not Representation Failures

    May 31, 2026Rashad Aziz, Ikhlasul Akmal Hanif, Fajri KotoLanguage Model CalibrationLLM Safety