Uniform-Certificate Bayesian Feature Head / bench_report.json

✓✓ Beats tuned baseline

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01,
 10      "weight_decay": 0.0
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "weight_decay": 0.0
 17        },
 18        "mean": 152.21145248413086
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.001,
 23          "weight_decay": 0.0001
 24        },
 25        "mean": 152.18722534179688
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.003,
 30          "weight_decay": 0.0
 31        },
 32        "mean": 101.97886276245117
 33      },
 34      {
 35        "cfg": {
 36          "lr": 0.003,
 37          "weight_decay": 0.0001
 38        },
 39        "mean": 101.97932815551758
 40      },
 41      {
 42        "cfg": {
 43          "lr": 0.01,
 44          "weight_decay": 0.0
 45        },
 46        "mean": 31.591657638549805
 47      },
 48      {
 49        "cfg": {
 50          "lr": 0.01,
 51          "weight_decay": 0.0001
 52        },
 53        "mean": 31.591760635375977
 54      }
 55    ],
 56    "full": {
 57      "mean": 33.03840112686157,
 58      "std": 2.3804098981535065,
 59      "per_seed": [
 60        34.395347595214844,
 61        31.198909759521484,
 62        32.69178009033203,
 63        28.08059310913086,
 64        36.69027328491211,
 65        33.26426696777344,
 66        34.30606460571289,
 67        33.67997360229492
 68      ],
 69      "n": 8
 70    }
 71  },
 72  "idea": {
 73    "per_seed": [
 74      10.268460273742676,
 75      10.212242126464844,
 76      9.813057899475098,
 77      10.562983512878418,
 78      13.34918212890625,
 79      11.693805694580078,
 80      10.852352142333984,
 81      13.36784839630127
 82    ],
 83    "mean": 11.264991521835327,
 84    "cfg": {
 85      "lr": 0.001,
 86      "weight_decay": 0.0
 87    },
 88    "sweep": [
 89      {
 90        "cfg": {
 91          "lr": 0.01,
 92          "weight_decay": 0.0
 93        },
 94        "mean": 24.510720252990723
 95      },
 96      {
 97        "cfg": {
 98          "lr": 0.001,
 99          "weight_decay": 0.0
100        },
101        "mean": 10.214185953140259
102      },
103      {
104        "cfg": {
105          "lr": 0.01,
106          "weight_decay": 0.0
107        },
108        "mean": 24.510720252990723
109      }
110    ]
111  },
112  "comparison": {
113    "delta_mean": -21.773409605026245,
114    "idea_wins": 8,
115    "n_pairs": 8,
116    "per_seed_diffs": [
117      -24.126887321472168,
118      -20.98666763305664,
119      -22.878722190856934,
120      -17.51760959625244,
121      -23.34109115600586,
122      -21.57046127319336,
123      -23.453712463378906,
124      -20.312125205993652
125    ],
126    "p_value": 0.0081,
127    "mde": 1.8140862942829863,
128    "mde_rel_pct": 5.4908416642718825,
129    "verdict": "idea better (significant)",
130    "system_worked": true
131  },
132  "mechanism_signature": {
133    "quantity": "trained-NN posterior uncertainty; upper-vs-lower quartile test residual and interval coverage",
134    "mean_high_to_low_sd_ratio": 3.6821917593479156,
135    "mean_sd": 0.013744487892836332,
136    "coverage_beta_2.5": 0.0084375,
137    "predicted_high_uncertainty_ratio_gt_1": true,
138    "confirmed": true,
139    "track_match": "tabular regression with shared MLP representation and Bayesian Fourier readout"
140  }
141}