Rank-Normalized Nonlinear Spectral Preconditioner / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "tabular",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.01,
10 "weight_decay": 0.0
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "weight_decay": 0.0
17 },
18 "mean": 14.369435787200928
19 },
20 {
21 "cfg": {
22 "lr": 0.001,
23 "weight_decay": 0.0001
24 },
25 "mean": 14.339182376861572
26 },
27 {
28 "cfg": {
29 "lr": 0.003,
30 "weight_decay": 0.0
31 },
32 "mean": 8.496363878250122
33 },
34 {
35 "cfg": {
36 "lr": 0.003,
37 "weight_decay": 0.0001
38 },
39 "mean": 8.167794823646545
40 },
41 {
42 "cfg": {
43 "lr": 0.01,
44 "weight_decay": 0.0
45 },
46 "mean": 7.075780034065247
47 },
48 {
49 "cfg": {
50 "lr": 0.01,
51 "weight_decay": 0.0001
52 },
53 "mean": 7.193095445632935
54 }
55 ],
56 "full": {
57 "mean": 7.234962344169617,
58 "std": 0.7865574747580145,
59 "per_seed": [
60 6.9322123527526855,
61 5.762338638305664,
62 7.506187438964844,
63 8.102381706237793,
64 7.3106536865234375,
65 6.380474090576172,
66 8.19311237335205,
67 7.692338466644287
68 ],
69 "n": 8
70 }
71 },
72 "idea": {
73 "mean": 7.675570726394653,
74 "std": 1.006710258489254,
75 "per_seed": [
76 7.532199382781982,
77 6.862549304962158,
78 8.377254486083984,
79 9.171204566955566,
80 7.1806640625,
81 5.912852764129639,
82 8.827324867248535,
83 7.540516376495361
84 ],
85 "n": 8
86 },
87 "comparison": {
88 "delta_mean": 0.4406083822250366,
89 "idea_wins": 3,
90 "n_pairs": 8,
91 "per_seed_diffs": [
92 0.5999870300292969,
93 1.1002106666564941,
94 0.8710670471191406,
95 1.0688228607177734,
96 -0.1299896240234375,
97 -0.4676213264465332,
98 0.6342124938964844,
99 -0.15182209014892578
100 ],
101 "p_value": 0.086,
102 "mde": 0.5075651661606405,
103 "mde_rel_pct": 7.015450005343402,
104 "verdict": "no significant win",
105 "system_worked": false
106 },
107 "mechanism_signature": {
108 "prediction": "rank normalization reduces activation covariance condition number and gradient spikes",
109 "observed": [
110 {
111 "seed": 0,
112 "metric": 7.532199382781982,
113 "median_condition": 49222378.0,
114 "max_grad_norm": 139.02621459960938
115 },
116 {
117 "seed": 1,
118 "metric": 6.862549304962158,
119 "median_condition": 46337590.0,
120 "max_grad_norm": 272.9651794433594
121 },
122 {
123 "seed": 2,
124 "metric": 8.377254486083984,
125 "median_condition": 50202086.0,
126 "max_grad_norm": 117.48654174804688
127 },
128 {
129 "seed": 3,
130 "metric": 9.171204566955566,
131 "median_condition": 47638106.0,
132 "max_grad_norm": 147.75779724121094
133 }
134 ],
135 "idea_sweep": [
136 {
137 "cfg": {
138 "lr": 0.001,
139 "strength": 0.25,
140 "eps": 0.01
141 },
142 "mean": 166.07542037963867
143 },
144 {
145 "cfg": {
146 "lr": 0.001,
147 "strength": 0.35,
148 "eps": 0.01
149 },
150 "mean": 171.13961791992188
151 },
152 {
153 "cfg": {
154 "lr": 0.001,
155 "strength": 0.5,
156 "eps": 0.01
157 },
158 "mean": 175.3752212524414
159 },
160 {
161 "cfg": {
162 "lr": 0.003,
163 "strength": 0.25,
164 "eps": 0.01
165 },
166 "mean": 13.039084672927856
167 },
168 {
169 "cfg": {
170 "lr": 0.003,
171 "strength": 0.35,
172 "eps": 0.01
173 },
174 "mean": 12.977247714996338
175 },
176 {
177 "cfg": {
178 "lr": 0.003,
179 "strength": 0.5,
180 "eps": 0.01
181 },
182 "mean": 12.668333530426025
183 },
184 {
185 "cfg": {
186 "lr": 0.01,
187 "strength": 0.25,
188 "eps": 0.01
189 },
190 "mean": 8.61996614933014
191 },
192 {
193 "cfg": {
194 "lr": 0.01,
195 "strength": 0.35,
196 "eps": 0.01
197 },
198 "mean": 8.203945398330688
199 },
200 {
201 "cfg": {
202 "lr": 0.01,
203 "strength": 0.5,
204 "eps": 0.01
205 },
206 "mean": 7.985801935195923
207 }
208 ],
209 "confirmed": false
210 },
211 "elapsed_sec": 252.72731709480286,
212 "protocol_note": "Tabular is structurally matched because this is an optimizer/preconditioning intervention; both systems use the same MLP and Adam apart from activation whitening."
213}