Uniform-Certificate Bayesian Feature Head / bench_report.json
Beats tuned baseline
1{
2 "bench_version": 1,
3 "track": "tabular",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.01,
10 "weight_decay": 0.0
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "weight_decay": 0.0
17 },
18 "mean": 152.21145248413086
19 },
20 {
21 "cfg": {
22 "lr": 0.001,
23 "weight_decay": 0.0001
24 },
25 "mean": 152.18722534179688
26 },
27 {
28 "cfg": {
29 "lr": 0.003,
30 "weight_decay": 0.0
31 },
32 "mean": 101.97886276245117
33 },
34 {
35 "cfg": {
36 "lr": 0.003,
37 "weight_decay": 0.0001
38 },
39 "mean": 101.97932815551758
40 },
41 {
42 "cfg": {
43 "lr": 0.01,
44 "weight_decay": 0.0
45 },
46 "mean": 31.591657638549805
47 },
48 {
49 "cfg": {
50 "lr": 0.01,
51 "weight_decay": 0.0001
52 },
53 "mean": 31.591760635375977
54 }
55 ],
56 "full": {
57 "mean": 33.03840112686157,
58 "std": 2.3804098981535065,
59 "per_seed": [
60 34.395347595214844,
61 31.198909759521484,
62 32.69178009033203,
63 28.08059310913086,
64 36.69027328491211,
65 33.26426696777344,
66 34.30606460571289,
67 33.67997360229492
68 ],
69 "n": 8
70 }
71 },
72 "idea": {
73 "per_seed": [
74 10.268460273742676,
75 10.212242126464844,
76 9.813057899475098,
77 10.562983512878418,
78 13.34918212890625,
79 11.693805694580078,
80 10.852352142333984,
81 13.36784839630127
82 ],
83 "mean": 11.264991521835327,
84 "cfg": {
85 "lr": 0.001,
86 "weight_decay": 0.0
87 },
88 "sweep": [
89 {
90 "cfg": {
91 "lr": 0.01,
92 "weight_decay": 0.0
93 },
94 "mean": 24.510720252990723
95 },
96 {
97 "cfg": {
98 "lr": 0.001,
99 "weight_decay": 0.0
100 },
101 "mean": 10.214185953140259
102 },
103 {
104 "cfg": {
105 "lr": 0.01,
106 "weight_decay": 0.0
107 },
108 "mean": 24.510720252990723
109 }
110 ]
111 },
112 "comparison": {
113 "delta_mean": -21.773409605026245,
114 "idea_wins": 8,
115 "n_pairs": 8,
116 "per_seed_diffs": [
117 -24.126887321472168,
118 -20.98666763305664,
119 -22.878722190856934,
120 -17.51760959625244,
121 -23.34109115600586,
122 -21.57046127319336,
123 -23.453712463378906,
124 -20.312125205993652
125 ],
126 "p_value": 0.0081,
127 "mde": 1.8140862942829863,
128 "mde_rel_pct": 5.4908416642718825,
129 "verdict": "idea better (significant)",
130 "system_worked": true
131 },
132 "mechanism_signature": {
133 "quantity": "trained-NN posterior uncertainty; upper-vs-lower quartile test residual and interval coverage",
134 "mean_high_to_low_sd_ratio": 3.6821917593479156,
135 "mean_sd": 0.013744487892836332,
136 "coverage_beta_2.5": 0.0084375,
137 "predicted_high_uncertainty_ratio_gt_1": true,
138 "confirmed": true,
139 "track_match": "tabular regression with shared MLP representation and Bayesian Fourier readout"
140 }
141}