Refusals

Momentum

16 papers in the last four weeks, down 6% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 137

All topics
CardsList
  1. TRACE: Trajectory Return Attribution and Contrastive Erasure for Multi-Turn Safety

    Oct 1, 2026Fengpeng Li, Kemou Li, Qizhou Wang +3Large Language Model SafetyAttack-Success Rate

  2. Deny Without Disabling: Authorization-Paired Evaluation and Control for Multi-Agent Systems

    Sep 30, 2026Yunbei Zhang, Saiyue Lyu, Janet Wang +4AuthorizationModel-Based Multi-Agent Systems

  3. Refusals That Bend: Measuring and Predicting Task Malleability in Embodied VLM Planners

    Sep 30, 2026Leo Y. Lin, Mikhail Kuznetsov, Muslum Ozgur Ozmen +1Safety AlignmentRefusals

  4. CompOrca: Corpus-Scale Compliance Labelling of Instruction-Tuning Data

    Sep 29, 2026Philipp E. Glass, Alina MironComplianceRefusals

  5. Safer Content or Firmer Refusals? A Hybrid Perturbation Defense for Alignment under Harmful Fine-tuning

    Sep 29, 2026Muhammad Zeeshan Akram, Mufid Kamel Marican, Anvesh Reddy Yenugu +2Model-Agnostic DefenseLarge Language Model Safety

  6. Less Sycophancy, Stronger Refusal? Lessons for AI Safety from Mechanistic Interpretability

    Sep 28, 2026Xu Wang, Difan Zou, Xuansheng WuSycophancyRefusals

  7. Tool Mediation Alters Refusal Mechanisms in Large Language Models

    Sep 28, 2026Abel Rodríguez, Giuseppe Garofalo, Lieven Desmet +1Large Language Models FailRefusals

  8. DeShortcut-Align: Decoupling Spurious Shortcuts for Robust Safety Alignment in Large Reasoning Models

    Sep 28, 2026Qirui Liu, Yichen Sun, Yan Wang +4Safety AlignmentLarge Language Model Alignment

  9. AgentBoundary: Counterfactual Evaluation of Safety in Tool-Using LLM Agents

    Sep 27, 2026Tianzhuo Yang, Zirui Mi, Yantao Huang +4RefusalsEvaluation Benchmarks

  10. A Policy Profile for Croissant: Refusal as a Property of the Dataset

    Sep 17, 2026Alexander ChernovGeneration ProvenanceTaco

  11. First Token Matters: Understanding Safety Collapse in Large Reasoning Models

    Sep 16, 2026Yizheng Yang, Haining Yu, Yuechen Wang +4Large Language Model SafetyLarge Reasoning Models

  12. Benchmarking Factual Robustness of LLMs via Multi-conversation Persuasion

    Sep 15, 2026Zhuoang CaiAttacker Large Language ModelPersuasion

  13. Style Over Substance: Content-Invariant Wrappers Flip LLM Safety-Judge Verdicts

    Sep 8, 2026Yongxi Zhou, Wenbo Ye, Yuanzhe Liu +2Large Language Model SafetyJailbreak Success Rates

  14. Mitigating LLM Over-Refusal via Dynamic Semantic Routing Calibration

    Sep 6, 2026Zixuan Wang, Bingjie Zhang, He Zhao +1Large Language Model SafetyRefusals

  15. Beyond Shallow Alignment: How Post-Training Methods Determine Refusal Circuits And Steering Robustness

    Sep 3, 2026Hoang Cuong Nguyen, Mark Dras, Usman NaseemRefusalsLarge Language Model Alignment

  16. Extracting Forgotten Prompts from Targeted Unlearned Models

    Sep 3, 2026Au Ashley Hoi-Ting, Meghdad Kurmanji, William F. Shen +2Exact UnlearningPrompt Engineering

  17. When Safety Routing Breaks: Understanding Alignment Fragility under Benign Fine-Tuning

    Sep 1, 2026Yitong Guo, Xiaoyi Chen, Siyuan Zhang +2FragilityModel Fine-Tuning

  18. A Unified Mechanistic Analysis of Knowledge- and Safety-Based Refusals

    Sep 1, 2026Yuri Son, Seunghee Kim, Hyuhng Joon Kim +1RefusalsLLM Reasoning Strategies

  19. Beyond Token Positions: Safety Alignment Across Denoising Steps in Diffusion Language Models

    Aug 31, 2026Guoli Wang, Haonan Shi, Tu Ouyang +1Diffusion Language ModelsLarge Language Model Safety

  20. Controlling Refusal Behavior of LLMs via Stiefel-Constrained Rotation Steering

    Aug 31, 2026Kirill Bunin, Dmitry Bylinkin, Vladimir Aletov +3Linear Activation SteeringSteering

  21. You Shouldn't Have Asked: A Pragmatics-Inspired Taxonomy for Evaluating LLM Refusals

    Aug 31, 2026Ruoxuan Li, Pinqiao Wang, Sheng Li +1RefusalsImplications

  22. The Safety Relay in Roleplay Jailbreaks: A Component-Resolved Causal Analysis of Harm Recognition and Refusal

    Aug 31, 2026Md Mokarram Chowdhury, Ernie Chang, Yang LiJailbreaksJailbreak Attacks

  23. ALTSTEER: Selective Safety Steering for Moving Beyond Hard Refusals to Constructive Alternatives

    Aug 31, 2026Hoejoon Kwon, Byeonggeuk Lim, Kahyeon Kim +1SteeringRefusals

  24. Refusing Intent, Not Form: Wrapper-Based Intent-Group Supervision for LLM Safety

    Aug 13, 2026Ping Wu, Haibo Tong, Feifei Zhao +7RefusalsLarge Language Model Safety

  25. How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment

    Aug 12, 2026Guang Yang, Fengchen Liu, Alex Wang +2Large Language Model AlignmentRefusals

  26. The Illusion of Cross-Lingual Safety in Low-Resource Languages

    Aug 11, 2026Abigail Oppong, P Sam Sahil, Tadesse Destaw Belay +12Multilingual SafetyLarge Language Model Safety

  27. When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs

    Aug 9, 2026Yu Ma, Hongli Shi, Jing Li +2Safety AlignmentRefusals

  28. Mood Matters: How Syntactic Sensitivity Undermines Safety Alignment

    Aug 5, 2026Alina Klerings, Jannik Brinkmann, Heiner Stuckenschmidt +1Safety AlignmentLarge Language Model Alignment

  29. Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

    Aug 5, 2026Xuzheng Yang, Jun Ling, Tao Huang +2RefusalsLLM Reasoning Strategies

  30. When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models

    Aug 4, 2026Yu Feng, Chunting Zang, Chen Shen +4RefusalsSuppression

  31. Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks

    Aug 2, 2026Shangze Li, Chuancheng Shi, Simiao Xie +6Model-Agnostic DefenseSafety Alignment

  32. HopRefusalBench: Diagnosing Refusal Failures in Search-Augmented Agents for Multi-Hop Reasoning

    Aug 2, 2026Jianan Xie, Xin Sun, Zhongqi Chen +3Search AgentsMulti-Hop Reasoning

  33. Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning

    Jul 31, 2026Xinyan Guan, Jiali Zeng, Chunlei Xin +5RefusalsLarge Language Model Training

  34. Rolling With Resistance: Preference-Optimized LLM Counselors Can Trade Goal Persistence for Relational Attunement in Motivational Interviewing

    Jul 30, 2026Weiying Chen, Junlong Shen, Zhexuan TangIntrinsic MotivationCounseling

  35. Asymmetric Collapse in Model Merging: When Refusal Over- writes Recognition

    Jul 26, 2026Aarnav Choudhary, Matheus Fonseca Rocha, Jiwon Seo +2Continual Model MergingSafety Alignment

  36. Geometric Configurations of Perturbed Jailbreak Prompts

    Jul 22, 2026Lynn Delcon, Andres Algaba, Vincent GinisLarge Language Model JailbreaksJailbreak Attacks

  37. Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents

    Jul 13, 2026Chenglin Yu, Li Yin, Ying Yu +4Refusals

  38. The Paternalistic Filter: Epistemic Injustice and Differential Refusal in LLM-Mediated History Education for Marginalized Romanian Students

    Jul 13, 2026Alexis Popovici, Andrei Ionascu, Adrian-Marius DumitranEpistemic StatesTutors

  39. Capabilities of Claude Fable 5 on Biomedical Challenge Problems

    Jul 12, 2026Dominic Okonkwo, Magnus Hodgson, Temitope I. David +1Biomedical TextDiagnostic Benchmark

  40. Minionese: Comprehensive Benchmark and Mechanistic Study of Multilingual LLM Safety

    Jul 11, 2026Chigozirim Ifebi, Brent Kong, Ayushi MehrotraMultilingual SafetyLarge Language Model Safety

  41. Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis

    Jul 7, 2026Mingchen Li, Meikang Qiu, Zifan Peng +4Large Language Model SafetyModel Vulnerabilities

  42. Faithfulness to Refusal: A Causal Audit of Neuron Selectors

    Jul 6, 2026Ananth Eswar, Pratinav Seth, Utsav Avaiya +1RefusalsCausal Intervention

  43. Evaluating calibrated refusal and safe usefulness in dual-use biology settings

    Jul 6, 2026Edwin H. Wintermute, Harmon Bhasin, Christina M. Agapakis +13RefusalsScientific Workflows

  44. Refused in Chat, Written in Code: Workflow-Level Jailbreak Construction in IDE Coding Agents

    Jul 4, 2026Abhishek Kumar, Carsten MapleCoding AgentsLarge Language Model Safety