cs.CLOct 5, 2026

Reward Stealing Attack on Large Language Models

Authors: Jiaming Qian, Pengyang Zhou, Jiahe Xu, Chaochao Chen

Organizations: Zhejiang University

Abstract

Adversarial attacks on Large Language Models (LLMs) aim to induce harmful content. However, existing methods suffer from high computational costs or strict model-pairing dependencies, limiting their scalability and transferability. We propose Reward Stealing Attack (ReSA), an adversarial attack framework that targets the latent safety reward underlying LLM alignment. ReSA employs maximum entropy inverse reinforcement learning to recover a proxy reward model solely from the aligned model's behavior. The extracted reward is then reversed at inference time to derive an adversarial policy, efficiently implemented via a reward-guided decoding mechanism. Experiments demonstrate that a single recovered reward generalizes across prompts and diverse models to reveal a fundamental alignment vulnerability, enabling ReSA to significantly outperform existing attacks in effectiveness and transferability. The code is available at https://github.com/GarminQ/ReSA.

Figures & tables

Appendix figures & tables8 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. Information Theoretic Adversarial Training of Large Language Models

    May 6, 2026Yiwei Zhang, Jeremiah Birrell, Reza Ebrahimi +3Adversarial TrainingKullback-Leibler Divergence

  2. Automated jailbreak attack targeting multiple defense strategies

    Jun 15, 2026Qi Wang, Chengcheng Wan, Weijia He +4Attacker Large Language ModelJailbreak Attacks

  3. Attention Is Where You Attack

    Apr 30, 2026Aviral Srivastava, Sourav PandaAdversarial ExamplesJailbreak Attacks