Tikhonov-Minimum-Norm Hypergradients / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "tabular",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "wd": 0.001
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "wd": 0.0
17 },
18 "mean": 17.79831099510193
19 },
20 {
21 "cfg": {
22 "lr": 0.001,
23 "wd": 0.0001
24 },
25 "mean": 17.804412841796875
26 },
27 {
28 "cfg": {
29 "lr": 0.001,
30 "wd": 0.001
31 },
32 "mean": 17.81385827064514
33 },
34 {
35 "cfg": {
36 "lr": 0.003,
37 "wd": 0.0
38 },
39 "mean": 13.153547525405884
40 },
41 {
42 "cfg": {
43 "lr": 0.003,
44 "wd": 0.0001
45 },
46 "mean": 13.136067628860474
47 },
48 {
49 "cfg": {
50 "lr": 0.003,
51 "wd": 0.001
52 },
53 "mean": 13.114951848983765
54 },
55 {
56 "cfg": {
57 "lr": 0.006,
58 "wd": 0.0
59 },
60 "mean": 9.905518293380737
61 },
62 {
63 "cfg": {
64 "lr": 0.006,
65 "wd": 0.0001
66 },
67 "mean": 9.729963302612305
68 },
69 {
70 "cfg": {
71 "lr": 0.006,
72 "wd": 0.001
73 },
74 "mean": 9.544940948486328
75 }
76 ],
77 "full": {
78 "mean": 9.642327845096588,
79 "std": 1.047326484601666,
80 "per_seed": [
81 9.891983985900879,
82 10.596479415893555,
83 8.670082092285156,
84 9.021218299865723,
85 7.615931034088135,
86 10.587333679199219,
87 9.936084747314453,
88 10.819509506225586
89 ],
90 "n": 8
91 }
92 },
93 "idea": {
94 "mean": 9.909327685832977,
95 "std": 1.2741297958180666,
96 "per_seed": [
97 10.186660766601562,
98 11.613065719604492,
99 8.699080467224121,
100 9.08471965789795,
101 7.6164374351501465,
102 10.533278465270996,
103 10.165548324584961,
104 11.37583065032959
105 ],
106 "n": 8
107 },
108 "comparison": {
109 "delta_mean": 0.26699984073638916,
110 "idea_wins": 1,
111 "n_pairs": 8,
112 "per_seed_diffs": [
113 0.2946767807006836,
114 1.0165863037109375,
115 0.028998374938964844,
116 0.06350135803222656,
117 0.0005064010620117188,
118 -0.054055213928222656,
119 0.2294635772705078,
120 0.5563211441040039
121 ],
122 "p_value": 0.04035,
123 "mde": 0.30311716666322375,
124 "mde_rel_pct": 3.143609837093103,
125 "verdict": "idea worse (significant)",
126 "system_worked": false
127 },
128 "mechanism_signature": {
129 "track_choice": "tabular matches optimizer/regularizer ideas; shared MLP.",
130 "idea_grid": [
131 {
132 "cfg": {
133 "lr": 0.001,
134 "eps0": 0.0001,
135 "eps_min": 1e-06,
136 "decay": 0.7
137 },
138 "result": {
139 "mean": 18.25679302215576,
140 "std": 1.6583796998792717,
141 "per_seed": [
142 17.28780174255371,
143 17.48930549621582,
144 20.83658218383789,
145 15.395792007446289,
146 17.73833656311035,
147 17.7778263092041,
148 19.221439361572266,
149 20.307260513305664
150 ],
151 "n": 8
152 }
153 },
154 {
155 "cfg": {
156 "lr": 0.003,
157 "eps0": 0.001,
158 "eps_min": 1e-06,
159 "decay": 0.7
160 },
161 "result": {
162 "mean": 13.504453182220459,
163 "std": 1.1547149957425087,
164 "per_seed": [
165 13.25252914428711,
166 13.844292640686035,
167 13.66245174407959,
168 11.70921802520752,
169 12.26156234741211,
170 13.167490005493164,
171 14.4833984375,
172 15.654683113098145
173 ],
174 "n": 8
175 }
176 },
177 {
178 "cfg": {
179 "lr": 0.006,
180 "eps0": 0.01,
181 "eps_min": 1e-06,
182 "decay": 0.7
183 },
184 "result": {
185 "mean": 9.909327685832977,
186 "std": 1.2741297958180666,
187 "per_seed": [
188 10.186660766601562,
189 11.613065719604492,
190 8.699080467224121,
191 9.08471965789795,
192 7.6164374351501465,
193 10.533278465270996,
194 10.165548324584961,
195 11.37583065032959
196 ],
197 "n": 8
198 }
199 }
200 ],
201 "selected_idea_cfg": {
202 "lr": 0.006,
203 "eps0": 0.01,
204 "eps_min": 1e-06,
205 "decay": 0.7
206 },
207 "signature": {
208 "prediction": "damped CG residual <= 1e-5 max(1, ||b||) on trained network",
209 "predicted_max_residual": 0.0005065035629272461,
210 "observed_max_residual": 80.76493072509766,
211 "epsilon_pair_relative_change_norm_proxy": 0.0031547897960990667,
212 "trained_model_parameter_norm": 8.515052795410156,
213 "confirmed": false
214 }
215 }
216}