HOCBF Safety Shield for Neural Policies / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 0.011979727074503899
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.011480113724246621
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.01
 27        },
 28        "mean": 0.01089512137696147
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.010755360592156649,
 33      "std": 0.0007592926101325314,
 34      "per_seed": [
 35        0.011042063124477863,
 36        0.010341632179915905,
 37        0.010630456730723381,
 38        0.01156633347272873,
 39        0.009633837267756462,
 40        0.00994141586124897,
 41        0.012083088979125023,
 42        0.010804057121276855
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 0.0106944281142205,
 49    "std": 0.0008047805784073931,
 50    "per_seed": [
 51      0.011074288748204708,
 52      0.010244293138384819,
 53      0.010536408983170986,
 54      0.011238972656428814,
 55      0.009480332024395466,
 56      0.009993376210331917,
 57      0.012290501035749912,
 58      0.010697252117097378
 59    ],
 60    "n": 8,
 61    "sweep": [
 62      {
 63        "cfg": {
 64          "lr": 0.01,
 65          "k1": 2.0,
 66          "k2": 2.0
 67        },
 68        "mean": 0.010773490881547332
 69      },
 70      {
 71        "cfg": {
 72          "lr": 0.001,
 73          "k1": 2.0,
 74          "k2": 2.0
 75        },
 76        "mean": 0.011927408631891012
 77      },
 78      {
 79        "cfg": {
 80          "lr": 0.01,
 81          "k1": 2.0,
 82          "k2": 2.0
 83        },
 84        "mean": 0.010773490881547332
 85      }
 86    ]
 87  },
 88  "comparison": {
 89    "delta_mean": -6.0932477936148643e-05,
 90    "idea_wins": 5,
 91    "n_pairs": 8,
 92    "per_seed_diffs": [
 93      3.222562372684479e-05,
 94      -9.733904153108597e-05,
 95      -9.404774755239487e-05,
 96      -0.0003273608162999153,
 97      -0.00015350524336099625,
 98      5.196034908294678e-05,
 99      0.00020741205662488937,
100      -0.00010680500417947769
101    ],
102    "p_value": 0.3172,
103    "mde": 0.00013315306137726604,
104    "mde_rel_pct": 1.2380157804692105,
105    "verdict": "no measurable effect",
106    "system_worked": false
107  },
108  "mechanism_signature": {
109    "trained_model_raw_constraint_violation_rate": 0.09859375,
110    "trained_model_shielded_constraint_violation_rate": 0.01265625,
111    "projection_activation_rate": 0.09859375,
112    "predicted_vs_observed": {
113      "predicted": 0.09859375,
114      "observed": 0.01265625
115    },
116    "confirmed": false
117  },
118  "custom_track": null
119}