Rank-Normalized Nonlinear Spectral Preconditioner / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01,
 10      "weight_decay": 0.0
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "weight_decay": 0.0
 17        },
 18        "mean": 14.369435787200928
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.001,
 23          "weight_decay": 0.0001
 24        },
 25        "mean": 14.339182376861572
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.003,
 30          "weight_decay": 0.0
 31        },
 32        "mean": 8.496363878250122
 33      },
 34      {
 35        "cfg": {
 36          "lr": 0.003,
 37          "weight_decay": 0.0001
 38        },
 39        "mean": 8.167794823646545
 40      },
 41      {
 42        "cfg": {
 43          "lr": 0.01,
 44          "weight_decay": 0.0
 45        },
 46        "mean": 7.075780034065247
 47      },
 48      {
 49        "cfg": {
 50          "lr": 0.01,
 51          "weight_decay": 0.0001
 52        },
 53        "mean": 7.193095445632935
 54      }
 55    ],
 56    "full": {
 57      "mean": 7.234962344169617,
 58      "std": 0.7865574747580145,
 59      "per_seed": [
 60        6.9322123527526855,
 61        5.762338638305664,
 62        7.506187438964844,
 63        8.102381706237793,
 64        7.3106536865234375,
 65        6.380474090576172,
 66        8.19311237335205,
 67        7.692338466644287
 68      ],
 69      "n": 8
 70    }
 71  },
 72  "idea": {
 73    "mean": 7.675570726394653,
 74    "std": 1.006710258489254,
 75    "per_seed": [
 76      7.532199382781982,
 77      6.862549304962158,
 78      8.377254486083984,
 79      9.171204566955566,
 80      7.1806640625,
 81      5.912852764129639,
 82      8.827324867248535,
 83      7.540516376495361
 84    ],
 85    "n": 8
 86  },
 87  "comparison": {
 88    "delta_mean": 0.4406083822250366,
 89    "idea_wins": 3,
 90    "n_pairs": 8,
 91    "per_seed_diffs": [
 92      0.5999870300292969,
 93      1.1002106666564941,
 94      0.8710670471191406,
 95      1.0688228607177734,
 96      -0.1299896240234375,
 97      -0.4676213264465332,
 98      0.6342124938964844,
 99      -0.15182209014892578
100    ],
101    "p_value": 0.086,
102    "mde": 0.5075651661606405,
103    "mde_rel_pct": 7.015450005343402,
104    "verdict": "no significant win",
105    "system_worked": false
106  },
107  "mechanism_signature": {
108    "prediction": "rank normalization reduces activation covariance condition number and gradient spikes",
109    "observed": [
110      {
111        "seed": 0,
112        "metric": 7.532199382781982,
113        "median_condition": 49222378.0,
114        "max_grad_norm": 139.02621459960938
115      },
116      {
117        "seed": 1,
118        "metric": 6.862549304962158,
119        "median_condition": 46337590.0,
120        "max_grad_norm": 272.9651794433594
121      },
122      {
123        "seed": 2,
124        "metric": 8.377254486083984,
125        "median_condition": 50202086.0,
126        "max_grad_norm": 117.48654174804688
127      },
128      {
129        "seed": 3,
130        "metric": 9.171204566955566,
131        "median_condition": 47638106.0,
132        "max_grad_norm": 147.75779724121094
133      }
134    ],
135    "idea_sweep": [
136      {
137        "cfg": {
138          "lr": 0.001,
139          "strength": 0.25,
140          "eps": 0.01
141        },
142        "mean": 166.07542037963867
143      },
144      {
145        "cfg": {
146          "lr": 0.001,
147          "strength": 0.35,
148          "eps": 0.01
149        },
150        "mean": 171.13961791992188
151      },
152      {
153        "cfg": {
154          "lr": 0.001,
155          "strength": 0.5,
156          "eps": 0.01
157        },
158        "mean": 175.3752212524414
159      },
160      {
161        "cfg": {
162          "lr": 0.003,
163          "strength": 0.25,
164          "eps": 0.01
165        },
166        "mean": 13.039084672927856
167      },
168      {
169        "cfg": {
170          "lr": 0.003,
171          "strength": 0.35,
172          "eps": 0.01
173        },
174        "mean": 12.977247714996338
175      },
176      {
177        "cfg": {
178          "lr": 0.003,
179          "strength": 0.5,
180          "eps": 0.01
181        },
182        "mean": 12.668333530426025
183      },
184      {
185        "cfg": {
186          "lr": 0.01,
187          "strength": 0.25,
188          "eps": 0.01
189        },
190        "mean": 8.61996614933014
191      },
192      {
193        "cfg": {
194          "lr": 0.01,
195          "strength": 0.35,
196          "eps": 0.01
197        },
198        "mean": 8.203945398330688
199      },
200      {
201        "cfg": {
202          "lr": 0.01,
203          "strength": 0.5,
204          "eps": 0.01
205        },
206        "mean": 7.985801935195923
207      }
208    ],
209    "confirmed": false
210  },
211  "elapsed_sec": 252.72731709480286,
212  "protocol_note": "Tabular is structurally matched because this is an optimizer/preconditioning intervention; both systems use the same MLP and Adam apart from activation whitening."
213}