Double-Geometric Layerwise ES / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "tabular",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "weight_decay": 0.0001
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.0015,
16 "weight_decay": 0.0
17 },
18 "mean": 16.004083156585693
19 },
20 {
21 "cfg": {
22 "lr": 0.0015,
23 "weight_decay": 0.0001
24 },
25 "mean": 16.01387643814087
26 },
27 {
28 "cfg": {
29 "lr": 0.003,
30 "weight_decay": 0.0
31 },
32 "mean": 12.535736083984375
33 },
34 {
35 "cfg": {
36 "lr": 0.003,
37 "weight_decay": 0.0001
38 },
39 "mean": 12.430302143096924
40 },
41 {
42 "cfg": {
43 "lr": 0.006,
44 "weight_decay": 0.0
45 },
46 "mean": 9.091599702835083
47 },
48 {
49 "cfg": {
50 "lr": 0.006,
51 "weight_decay": 0.0001
52 },
53 "mean": 8.875346541404724
54 }
55 ],
56 "full": {
57 "mean": 9.257637917995453,
58 "std": 0.7946203059794043,
59 "per_seed": [
60 9.313394546508789,
61 7.957194805145264,
62 8.725268363952637,
63 9.505528450012207,
64 8.830371856689453,
65 9.170703887939453,
66 10.88531494140625,
67 9.67332649230957
68 ],
69 "n": 8
70 }
71 },
72 "idea": {
73 "mean": 10.167674660682678,
74 "std": 1.8586175283157877,
75 "per_seed": [
76 12.230741500854492,
77 8.306159973144531,
78 8.560102462768555,
79 9.36517333984375,
80 8.156329154968262,
81 9.683719635009766,
82 13.33909797668457,
83 11.7000732421875
84 ],
85 "n": 8
86 },
87 "comparison": {
88 "delta_mean": 0.9100367426872253,
89 "idea_wins": 3,
90 "n_pairs": 8,
91 "per_seed_diffs": [
92 2.917346954345703,
93 0.3489651679992676,
94 -0.16516590118408203,
95 -0.14035511016845703,
96 -0.6740427017211914,
97 0.5130157470703125,
98 2.4537830352783203,
99 2.0267467498779297
100 ],
101 "p_value": 0.129,
102 "mde": 1.1351211014956983,
103 "mde_rel_pct": 12.261454936460563,
104 "verdict": "no significant win",
105 "system_worked": false
106 },
107 "idea_sweep": [
108 {
109 "cfg": {
110 "lr": 0.006,
111 "rho": 0.12,
112 "beta": 0.85,
113 "epochs": 12,
114 "K": 6
115 },
116 "mean": 9.615544319152832
117 },
118 {
119 "cfg": {
120 "lr": 0.0015,
121 "rho": 0.12,
122 "beta": 0.85,
123 "epochs": 12,
124 "K": 6
125 },
126 "mean": 15.944299936294556
127 },
128 {
129 "cfg": {
130 "lr": 0.006,
131 "rho": 0.12,
132 "beta": 0.85,
133 "epochs": 12,
134 "K": 6
135 },
136 "mean": 9.615544319152832
137 }
138 ],
139 "track_justification": "Optimizer intervention matches tabular MLP training; both systems share architecture and data.",
140 "budget": {
141 "epochs": 12,
142 "batch": 64,
143 "candidates_per_epoch": 6,
144 "seeds": 8
145 },
146 "mechanism_signature": {
147 "predicted": "utility-|z| covariance should determine q update direction",
148 "observed_note": "trained-model candidate losses and DG q updates were collected during each run",
149 "predicted_vs_observed": "see per-seed trained metrics; no fixed quantitative tolerance claimed",
150 "confirmed": false
151 }
152}