Over-Refusal

Latest papers 20

All topics
CardsList
  1. EmoRSS: Mitigating Emotion-Induced Over-Refusal in Large Language Models

    Oct 4, 2026Shuyi Miao, Yaojin Ma, Chenhang Cui +5LLM AlignmentLLM Refusal Behavior

  2. OpenMTB-Audit: Exposing Over-Refusal and Clinical Expert Perspectives in LLM-Based Molecular Tumor Board Safety Evaluation

    Oct 1, 2026Negin Ashrafi, Jia Luo, Stacey M. Frumm +1LLM Safety BenchmarksLLM Auditing

  3. DeShortcut-Align: Decoupling Spurious Shortcuts for Robust Safety Alignment in Large Reasoning Models

    Sep 28, 2026Qirui Liu, Yichen Sun, Yan Wang +4LLM Safety AlignmentAdversarial Robustness of Language Models

  4. AgentBoundary: Counterfactual Evaluation of Safety in Tool-Using LLM Agents

    Sep 27, 2026Tianzhuo Yang, Zirui Mi, Yantao Huang +4LLM Agent EvaluationLLM Agents

  5. AUDITPLAN: Commit, Then Answer for Auditable Safety Alignment

    Sep 16, 2026Sai Sri Pushpa Jampani, Kshitij Mishra, Asif EkbalLLM AlignmentLLM Auditing

  6. Mitigating LLM Over-Refusal via Dynamic Semantic Routing Calibration

    Sep 6, 2026Zixuan Wang, Bingjie Zhang, He Zhao +1Mechanistic InterpretabilityLLM Refusal Behavior

  7. HiRoute: Hierarchical Routed Prompt Tuning for Safety Alignment of Large Language Models

    Aug 13, 2026Fangzhou Chen, Shiji Zhao, Mengyang Wang +4LLM Safety AlignmentPrompt Tuning

  8. OPIUM: Mitigating Steering Externalities and Over-Refusal via Dual Objective Latent Optimization

    Jul 22, 2026Kavin Aravindan, Arihant Rastogi, Krishak Aneja +4LLM Safety AlignmentOver-Refusal

  9. Addressing Over-Refusal in LLMs with Competing Rewards

    Jun 30, 2026Taeyoun Kim, Aviral KumarRL for Language Model ReasoningLLM Safety

  10. LLMs Prompted for Legal Context Object More: Overrefusal from Small On-Premises LLMs in Criminal Legal Context

    Jun 23, 2026Anastasiia Kucherenko, François Brouchoud, Dimitri Percia David +1LLM PromptingSmall Language Models

  11. Measuring & Mitigating Over-Alignment for LLMs in Multilingual Criminal Law Courts

    Jun 22, 2026Arthur Wuhrmann, Gaetan Stein, Daniel Brunner +1Multilingual Language Model EvaluationLegal NLP

  12. FreoStream:Enhancing Stream Guardrails via Future-Aware Reasoning and Safety-Aligned Optimization

    Jun 11, 2026Jianwei Wang, Guoyang Shen, Yanhong Wu +5LLM GuardrailsOver-Refusal

  13. DDOR: Delta Debugging for Explainable Overrefusal Testing and Repair

    Jun 2, 2026Qinyan Zhou, Peixin Zhang, Jun Sun +2LLM GuardrailsLLM Refusal Behavior

  14. The Refusal--Compliance Tradeoff: A Large-Scale Safety Behavior Audit of Large Language Models

    May 6, 2026Alif Al Hasan, Sumon BiswasLLM Safety BenchmarksLanguage Model Safety Evaluation

  15. Self-Mined Hardness for Safety Fine-Tuning

    May 4, 2026Prakhar Gupta, Garv Shah, Donghua ZhangHard Negative MiningLLM Fine-Tuning

  16. Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding

    Apr 18, 2026Yupeng Qi, Ziyu Lyu, Lixin Cui +2Language Model Safety EvaluationLLM Refusal Behavior

  17. On Safety Risks in Experience-Driven Self-Evolving Agents

    Apr 18, 2026Weixiang Zhao, Yichen Zhang, Yingshuo Wang +8LLM Safety EvaluationOver-Refusal