Barrier-Certified Neural Policy Training / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "robust_cbf_pendulum_policy",
  4  "model": "shared_mlp_32",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "epochs": 15,
 11      "barrier": false
 12    },
 13    "sweep": [
 14      {
 15        "cfg": {
 16          "lr": 0.001,
 17          "epochs": 15,
 18          "barrier": false
 19        },
 20        "mean": 0.021794200874865055
 21      },
 22      {
 23        "cfg": {
 24          "lr": 0.003,
 25          "epochs": 15,
 26          "barrier": false
 27        },
 28        "mean": 0.002334954886464402
 29      },
 30      {
 31        "cfg": {
 32          "lr": 0.006,
 33          "epochs": 15,
 34          "barrier": false
 35        },
 36        "mean": 0.0018331437022425234
 37      }
 38    ],
 39    "full": {
 40      "mean": 0.0019978795608039945,
 41      "std": 0.0005495084055684182,
 42      "per_seed": [
 43        0.0015628907131031156,
 44        0.0015461408765986562,
 45        0.0021467802580446005,
 46        0.0020767629612237215,
 47        0.0030877823010087013,
 48        0.0011752876453101635,
 49        0.0020312685519456863,
 50        0.0023561231791973114
 51      ],
 52      "n": 8
 53    }
 54  },
 55  "idea": {
 56    "mean": 0.002375210518948734,
 57    "std": 0.0007107137551610928,
 58    "per_seed": [
 59      0.0017161896685138345,
 60      0.002388743683695793,
 61      0.003441448090597987,
 62      0.002218520501628518,
 63      0.0035038175992667675,
 64      0.0017992532812058926,
 65      0.0024698558263480663,
 66      0.0014638555003330112
 67    ],
 68    "n": 8,
 69    "selection_sweep": [
 70      {
 71        "cfg": {
 72          "lr": 0.001,
 73          "epochs": 15,
 74          "barrier": true,
 75          "weight": 1.0
 76        },
 77        "mean": 0.03862802591174841
 78      },
 79      {
 80        "cfg": {
 81          "lr": 0.003,
 82          "epochs": 15,
 83          "barrier": true,
 84          "weight": 2.0
 85        },
 86        "mean": 0.0024412254861090332
 87      },
 88      {
 89        "cfg": {
 90          "lr": 0.006,
 91          "epochs": 15,
 92          "barrier": true,
 93          "weight": 4.0
 94        },
 95        "mean": 0.003327691287267953
 96      }
 97    ]
 98  },
 99  "comparison": {
100    "delta_mean": 0.00037733095814473927,
101    "idea_wins": 1,
102    "n_pairs": 8,
103    "per_seed_diffs": [
104      0.00015329895541071892,
105      0.000842602807097137,
106      0.0012946678325533867,
107      0.0001417575404047966,
108      0.0004160352982580662,
109      0.0006239656358957291,
110      0.00043858727440238,
111      -0.0008922676788643003
112    ],
113    "p_value": 0.1407,
114    "mde": 0.0005327468319021694,
115    "mde_rel_pct": 26.665613000604466,
116    "verdict": "no significant win",
117    "system_worked": false
118  },
119  "mechanism_signature": {
120    "prediction": {
121      "lower_bound": "epsilon - L_r delta",
122      "delta": 0.0052734375
123    },
124    "observed_from_trained_models": {
125      "min_residual_mean": -3.3228249847888947,
126      "violation_fraction_mean": 0.2471875,
127      "L_r_estimate_mean": 1.372166395187378,
128      "bound_lower_mean": 0.07276396627537907,
129      "n_models": 8
130    },
131    "confirmed": false
132  },
133  "custom_track": {
134    "name": "barrier_certified_pendulum_policy",
135    "file": "barrier_bench.py",
136    "domain": "dynamics"
137  }
138}