Learning-Rate-Scaled Weight Decay / bench_report.json
Beats tuned baseline
1{
2 "bench_version": 1,
3 "track": "tabular",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "weight_decay": 0.001
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.0015,
16 "weight_decay": 0.001
17 },
18 "mean": 16.25991463661194
19 },
20 {
21 "cfg": {
22 "lr": 0.0015,
23 "weight_decay": 0.01
24 },
25 "mean": 16.260149240493774
26 },
27 {
28 "cfg": {
29 "lr": 0.003,
30 "weight_decay": 0.001
31 },
32 "mean": 13.776280879974365
33 },
34 {
35 "cfg": {
36 "lr": 0.003,
37 "weight_decay": 0.01
38 },
39 "mean": 13.777657508850098
40 },
41 {
42 "cfg": {
43 "lr": 0.006,
44 "weight_decay": 0.001
45 },
46 "mean": 11.124481439590454
47 },
48 {
49 "cfg": {
50 "lr": 0.006,
51 "weight_decay": 0.01
52 },
53 "mean": 11.131932497024536
54 }
55 ],
56 "full": {
57 "mean": 11.662253737449646,
58 "std": 1.1646783408667203,
59 "per_seed": [
60 11.829092979431152,
61 10.211130142211914,
62 11.012014389038086,
63 11.445688247680664,
64 10.679678916931152,
65 11.089096069335938,
66 13.720934867858887,
67 13.310394287109375
68 ],
69 "n": 8
70 }
71 },
72 "idea": {
73 "mean": 11.662033557891846,
74 "std": 1.16472778990251,
75 "per_seed": [
76 11.828662872314453,
77 10.210942268371582,
78 11.011709213256836,
79 11.445385932922363,
80 10.679506301879883,
81 11.088908195495605,
82 13.720953941345215,
83 13.310199737548828
84 ],
85 "n": 8,
86 "selected_cfg": {
87 "lr": 0.006,
88 "weight_decay": 0.001
89 },
90 "sweep": [
91 {
92 "cfg": {
93 "lr": 0.0015,
94 "weight_decay": 0.001
95 },
96 "mean": 16.26001787185669
97 },
98 {
99 "cfg": {
100 "lr": 0.0015,
101 "weight_decay": 0.01
102 },
103 "mean": 16.261214017868042
104 },
105 {
106 "cfg": {
107 "lr": 0.003,
108 "weight_decay": 0.001
109 },
110 "mean": 13.776211261749268
111 },
112 {
113 "cfg": {
114 "lr": 0.003,
115 "weight_decay": 0.01
116 },
117 "mean": 13.776825904846191
118 },
119 {
120 "cfg": {
121 "lr": 0.006,
122 "weight_decay": 0.001
123 },
124 "mean": 11.124175071716309
125 },
126 {
127 "cfg": {
128 "lr": 0.006,
129 "weight_decay": 0.01
130 },
131 "mean": 11.128536701202393
132 }
133 ]
134 },
135 "comparison": {
136 "delta_mean": -0.00022017955780029297,
137 "idea_wins": 7,
138 "n_pairs": 8,
139 "per_seed_diffs": [
140 -0.00043010711669921875,
141 -0.00018787384033203125,
142 -0.00030517578125,
143 -0.00030231475830078125,
144 -0.00017261505126953125,
145 -0.00018787384033203125,
146 1.9073486328125e-05,
147 -0.000194549560546875
148 ],
149 "p_value": 0.0169,
150 "mde": 0.0001096098618612078,
151 "mde_rel_pct": 0.0009398686079795221,
152 "verdict": "idea better (significant)",
153 "system_worked": true
154 },
155 "mechanism_signature": {
156 "source": "trained mlp_tiny models on Friedman#1; decay boundaries instrumented during full paired runs",
157 "predicted_mean_decay_multiplier": 0.9999976694444446,
158 "observed_mean_decay_multiplier": 0.9999976609459289,
159 "multiplier_abs_error": 8.498515668975415e-09,
160 "cooldown_predicted_log_ratio": 0.2521996381548064,
161 "cooldown_observed_log_ratio": 1.2277044265333381,
162 "cooldown_ratio_abs_error": 0.9755047883785317,
163 "confirmed": false
164 },
165 "protocol_notes": {
166 "epochs": 30,
167 "batch": 128,
168 "grid_union": [
169 {
170 "lr": 0.0015,
171 "weight_decay": 0.001
172 },
173 {
174 "lr": 0.0015,
175 "weight_decay": 0.01
176 },
177 {
178 "lr": 0.003,
179 "weight_decay": 0.001
180 },
181 {
182 "lr": 0.003,
183 "weight_decay": 0.01
184 },
185 {
186 "lr": 0.006,
187 "weight_decay": 0.001
188 },
189 {
190 "lr": 0.006,
191 "weight_decay": 0.01
192 }
193 ],
194 "selection_seeds": [
195 0,
196 1,
197 2,
198 3
199 ],
200 "paired_seeds": [
201 0,
202 1,
203 2,
204 3,
205 4,
206 5,
207 6,
208 7
209 ],
210 "structural_match": "tabular is the built-in optimizer/regularizer track"
211 }
212}