Petri-Net Safety Shield for Neural Policies / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01,
 10      "epochs": 12
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "epochs": 12
 17        },
 18        "mean": 0.004103701037820429
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "epochs": 12
 24        },
 25        "mean": 0.0033861721749417484
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.01,
 30          "epochs": 12
 31        },
 32        "mean": 0.0014241317112464458
 33      }
 34    ],
 35    "full": {
 36      "mean": 0.001394080012687482,
 37      "std": 0.0003941947646392458,
 38      "per_seed": [
 39        0.0008339877240359783,
 40        0.0018332540057599545,
 41        0.001035665743984282,
 42        0.0019936193712055683,
 43        0.0009847625624388456,
 44        0.0013270708732306957,
 45        0.0016533465823158622,
 46        0.0014909332385286689
 47      ],
 48      "n": 8
 49    }
 50  },
 51  "idea": {
 52    "mean": 0.0013935517708887346,
 53    "std": 0.0003435936282481101,
 54    "per_seed": [
 55      0.000962425721809268,
 56      0.0018949415534734726,
 57      0.0011497323866933584,
 58      0.0018263080855831504,
 59      0.0009521312895230949,
 60      0.0014383804518729448,
 61      0.0016268157633021474,
 62      0.0012976789148524404
 63    ],
 64    "n": 8
 65  },
 66  "comparison": {
 67    "delta_mean": -5.282417987473309e-07,
 68    "idea_wins": 4,
 69    "n_pairs": 8,
 70    "per_seed_diffs": [
 71      0.00012843799777328968,
 72      6.168754771351814e-05,
 73      0.0001140666427090764,
 74      -0.00016731128562241793,
 75      -3.263127291575074e-05,
 76      0.00011130957864224911,
 77      -2.653081901371479e-05,
 78      -0.00019325432367622852
 79    ],
 80    "p_value": 0.98515,
 81    "mde": 0.0001061475231632145,
 82    "mde_rel_pct": 7.614162902930173,
 83    "verdict": "no measurable effect",
 84    "system_worked": false
 85  },
 86  "mechanism_signature": {
 87    "prediction": "accepted Petri successors remain admissible",
 88    "closure_violations": 0,
 89    "predicted_unsafe_accepted_rate": 0.0,
 90    "observed_unsafe_prediction_rate_trained_idea": 0.07,
 91    "observed_rejection_rate_trained_task_inputs": 0.05347656179219484,
 92    "trained_model_rows": [
 93      {
 94        "seed": 0,
 95        "baseline_metric": 0.0008339877240359783,
 96        "idea_metric": 0.000962425721809268,
 97        "baseline_unsafe_prediction_rate": 0.045,
 98        "idea_unsafe_prediction_rate": 0.0425,
 99        "shield_rejection_rate": 0.03531249985098839
100      },
101      {
102        "seed": 1,
103        "baseline_metric": 0.0018332540057599545,
104        "idea_metric": 0.0018949415534734726,
105        "baseline_unsafe_prediction_rate": 0.095,
106        "idea_unsafe_prediction_rate": 0.0975,
107        "shield_rejection_rate": 0.059687498956918716
108      },
109      {
110        "seed": 2,
111        "baseline_metric": 0.001035665743984282,
112        "idea_metric": 0.0011497323866933584,
113        "baseline_unsafe_prediction_rate": 0.055,
114        "idea_unsafe_prediction_rate": 0.055,
115        "shield_rejection_rate": 0.051874998956918716
116      },
117      {
118        "seed": 3,
119        "baseline_metric": 0.0019936193712055683,
120        "idea_metric": 0.0018263080855831504,
121        "baseline_unsafe_prediction_rate": 0.1225,
122        "idea_unsafe_prediction_rate": 0.1225,
123        "shield_rejection_rate": 0.0793749988079071
124      },
125      {
126        "seed": 4,
127        "baseline_metric": 0.0009847625624388456,
128        "idea_metric": 0.0009521312895230949,
129        "baseline_unsafe_prediction_rate": 0.0725,
130        "idea_unsafe_prediction_rate": 0.07,
131        "shield_rejection_rate": 0.054999999701976776
132      },
133      {
134        "seed": 5,
135        "baseline_metric": 0.0013270708732306957,
136        "idea_metric": 0.0014383804518729448,
137        "baseline_unsafe_prediction_rate": 0.0325,
138        "idea_unsafe_prediction_rate": 0.0325,
139        "shield_rejection_rate": 0.03312499821186066
140      },
141      {
142        "seed": 6,
143        "baseline_metric": 0.0016533465823158622,
144        "idea_metric": 0.0016268157633021474,
145        "baseline_unsafe_prediction_rate": 0.055,
146        "idea_unsafe_prediction_rate": 0.0575,
147        "shield_rejection_rate": 0.05843750014901161
148      },
149      {
150        "seed": 7,
151        "baseline_metric": 0.0014909332385286689,
152        "idea_metric": 0.0012976789148524404,
153        "baseline_unsafe_prediction_rate": 0.0825,
154        "idea_unsafe_prediction_rate": 0.0825,
155        "shield_rejection_rate": 0.054999999701976776
156      }
157    ],
158    "confirmed": true
159  },
160  "idea_sweep": [
161    {
162      "cfg": {
163        "lr": 0.001,
164        "epochs": 12
165      },
166      "result": {
167        "mean": 0.004844218114158139,
168        "std": 0.0021060335026899866,
169        "per_seed": [
170          0.0076133571565151215,
171          0.0035649114288389683,
172          0.001954183680936694,
173          0.002968552988022566,
174          0.00587603310123086,
175          0.004371007438749075,
176          0.00404327642172575,
177          0.008362422697246075
178        ],
179        "n": 8
180      }
181    },
182    {
183      "cfg": {
184        "lr": 0.003,
185        "epochs": 12
186      },
187      "result": {
188        "mean": 0.002841877590981312,
189        "std": 0.0016170159627390552,
190        "per_seed": [
191          0.0020566112361848354,
192          0.0030648154206573963,
193          0.0009700310183688998,
194          0.006774549372494221,
195          0.0028293621726334095,
196          0.002948844339698553,
197          0.002073001815006137,
198          0.002017805352807045
199        ],
200        "n": 8
201      }
202    },
203    {
204      "cfg": {
205        "lr": 0.01,
206        "epochs": 12
207      },
208      "result": {
209        "mean": 0.0013935517708887346,
210        "std": 0.0003435936282481101,
211        "per_seed": [
212          0.000962425721809268,
213          0.0018949415534734726,
214          0.0011497323866933584,
215          0.0018263080855831504,
216          0.0009521312895230949,
217          0.0014383804518729448,
218          0.0016268157633021474,
219          0.0012976789148524404
220        ],
221        "n": 8
222      }
223    }
224  ],
225  "selected_idea_cfg": {
226    "lr": 0.01,
227    "epochs": 12
228  },
229  "track_justification": "dynamics is the matched control/stability benchmark: actuated pendulum rollouts."
230}