Reachable-Set Risk Head for Early-Warning Rollouts / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 0.004298779065720737
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.0034615940821822733
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.006
 27        },
 28        "mean": 0.0018282315868418664
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.002105819425196387,
 33      "std": 0.000389436566226016,
 34      "per_seed": [
 35        0.002004395006224513,
 36        0.001437882543541491,
 37        0.0015748648438602686,
 38        0.002295783953741193,
 39        0.0024020641576498747,
 40        0.0024898042902350426,
 41        0.0020851334556937218,
 42        0.0025566271506249905
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 1.4290764033794403,
 49    "std": 0.10048076612287149,
 50    "per_seed": [
 51      1.3990658521652222,
 52      1.322527527809143,
 53      1.6020216941833496,
 54      1.576513409614563,
 55      1.3529068231582642,
 56      1.4524457454681396,
 57      1.3324311971664429,
 58      1.394698977470398
 59    ],
 60    "n": 8,
 61    "sweep": [
 62      {
 63        "cfg": {
 64          "lr": 0.006,
 65          "risk_weight": 0.15
 66        },
 67        "mean": 1.5168477594852448
 68      },
 69      {
 70        "cfg": {
 71          "lr": 0.001,
 72          "risk_weight": 0.08
 73        },
 74        "mean": 1.4750321209430695
 75      },
 76      {
 77        "cfg": {
 78          "lr": 0.006,
 79          "risk_weight": 0.25
 80        },
 81        "mean": 1.4902327060699463
 82      }
 83    ],
 84    "best_cfg": {
 85      "lr": 0.001,
 86      "risk_weight": 0.08
 87    }
 88  },
 89  "comparison": {
 90    "delta_mean": 1.426970583954244,
 91    "idea_wins": 0,
 92    "n_pairs": 8,
 93    "per_seed_diffs": [
 94      1.3970614571589977,
 95      1.3210896452656016,
 96      1.6004468293394893,
 97      1.5742176256608218,
 98      1.3505047590006143,
 99      1.4499559411779046,
100      1.3303460637107491,
101      1.392142350319773
102    ],
103    "p_value": 0.0081,
104    "mde": 0.08983758701469045,
105    "mde_rel_pct": 4266.1581491638235,
106    "verdict": "idea worse (significant)",
107    "system_worked": false
108  },
109  "mechanism_signature": {
110    "predicted": "risk increases as Mahalanobis safety margin decreases",
111    "margin_risk_correlation": -0.5783055626522379,
112    "low_margin_risk": 0.3624718189239502,
113    "high_margin_risk": 0.0,
114    "confirmed": false
115  },
116  "protocol_notes": "Paired 8 seeds; baseline and idea share GRU width, epochs, batch and learning-rate union; idea modifies training with Gaussian risk loss."
117}