cs.LGOct 4, 2026

Arithmetic Actor Heads and Training Stabilization for Out-of-Distribution Reinforcement Learning

Authors: Yifan Zhang, Liang Zheng

Organizations: Central South University

Abstract

Reinforcement learning (RL) policies can deteriorate under out-of-distribution (OOD) magnitude shifts. Starting from soft actor-critic (SAC) and its Bayesian Amnesic Piecewise-Robust (BAPR) predecessor, we study the causal-symbolic BAPR (CS-BAPR) family. The practical method combines six training-stabilization settings with alternative actor heads: a Neural Addition Unit (NAU) with a Neural Multiplication Unit (NMU)-inspired quadratic correction, a Kolmogorov-Arnold Network (KAN), or a multilayer perceptron (MLP) with rectified linear unit (ReLU) or hyperbolic-tangent activations.

Figures & tables

Appendix figures & tables1 asset

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. AdamO: A Collapse-Suppressed Optimizer for Offline RL

    May 3, 2026Nan Qiao, Sheng Yue, Shuning Wang +1Offline Reinforcement LearningSoft Actor-Critic

  2. Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning

    May 6, 2026Qingjun Wang, Hongtu Zhou, Hang Yu +5Out-Of-Distribution DetectionOut-Of-Distribution