| Model | Init. | Reward | Δ Forget ↓ | Δ Neighbor ↑ | Δ MIA-F ↑ | Δ MIA-R ↓ | GA ↑ | RA ↑ | TRU ↑ | FAC ↑ | FLU ↑ | N |
|---|
| GRPO runs |
| 0.5B | Cold | R0-Lex | −0.069[−0.123,−0.023] | −0.007[−0.079,0.054] | 1.566[0.900,2.076] | 0.659[0.421,0.932] | 0.474[0.456,0.498] | 0.123[0.105,0.136] | 0.290[0.280,0.315] | 0.206[0.195,0.215] | 4.751[4.560,5.306] | 10 |
| 0.5B | Cold | R1-AntiRefusal | −0.069[−0.123,−0.023] | −0.021[−0.061,0.032] | 1.089[0.638,1.303] | 0.441[0.264,0.586] | 0.465[0.442,0.500] | 0.142[0.108,0.170] | 0.300[0.285,0.315] | 0.136[0.115,0.165] | 6.771[6.604,6.979] | 10 |
| 0.5B | Cold | R2-Rubric | −0.038[−0.083,−0.030] | 0.020[−0.010,0.042] | 0.562[0.500,0.656] | 0.657[0.508,0.813] | 0.474[0.474,0.491] | 0.148[0.123,0.185] | 0.340[0.300,0.340] | 0.172[0.160,0.173] | 6.889[6.884,6.934] | 5 |
| 0.5B | Cold | R4-Refusal | −0.048[−0.093,−0.016] | −0.035[−0.081,0.005] | 1.070[0.693,2.038] | 0.840[0.748,1.023] | 0.480[0.452,0.500] | 0.166[0.126,0.192] | 0.290[0.265,0.315] | 0.192[0.185,0.200] | 4.351[4.138,4.447] | 10 |
| 0.5B | Warm | R0-Lex | −0.107[−0.148,−0.051] | −0.075[−0.091,0.002] | 2.625[1.371,3.542] | 1.055[0.826,1.240] | 0.474[0.453,0.504] | 0.166[0.129,0.198] | 0.300[0.265,0.315] | 0.227[0.194,0.250] | 5.787[5.450,6.125] | 10 |