Residual-Tightened Neural Safety Shield / results.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
 1{
 2  "seed": 544,
 3  "sigma_r": 0.2,
 4  "kappa": 1.0,
 5  "math_check": {
 6    "d": [
 7      0.0,
 8      0.02,
 9      0.05,
10      0.2,
11      0.8
12    ],
13    "r_at_ema_equal_d": [
14      0.0,
15      0.09090909090909091,
16      0.2,
17      0.5,
18      0.8
19    ],
20    "tightening_margin": [
21      0.0,
22      0.09090909090909091,
23      0.2,
24      0.5,
25      0.8
26    ],
27    "r_monotone": true,
28    "max_projection_constraint_violation": 1.1102230246251565e-16,
29    "constraint_satisfied": true
30  },
31  "experiment": {
32    "nominal_unshielded": {
33      "violation_rate": 0.0,
34      "mean_action_deviation": 0.0,
35      "mean_reward": -0.005490534225707342
36    },
37    "nominal_fixed": {
38      "violation_rate": 0.0,
39      "mean_action_deviation": 0.3875413736135295,
40      "mean_reward": -0.23340531676644
41    },
42    "nominal_adaptive": {
43      "violation_rate": 0.0,
44      "mean_action_deviation": 0.0,
45      "mean_reward": -0.005491596774677281
46    },
47    "shifted_unshielded": {
48      "violation_rate": 1.0,
49      "mean_action_deviation": 0.0,
50      "mean_reward": -0.11336081586839418
51    },
52    "shifted_fixed": {
53      "violation_rate": 0.0,
54      "mean_action_deviation": 0.4612857142857539,
55      "mean_reward": -0.015070375678229206
56    },
57    "shifted_adaptive": {
58      "violation_rate": 0.02,
59      "mean_action_deviation": 0.49816108846300994,
60      "mean_reward": -0.026906702730669113
61    }
62  }
63}