Tikhonov-Minimum-Norm Hypergradients / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "wd": 0.001
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "wd": 0.0
 17        },
 18        "mean": 17.79831099510193
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.001,
 23          "wd": 0.0001
 24        },
 25        "mean": 17.804412841796875
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.001,
 30          "wd": 0.001
 31        },
 32        "mean": 17.81385827064514
 33      },
 34      {
 35        "cfg": {
 36          "lr": 0.003,
 37          "wd": 0.0
 38        },
 39        "mean": 13.153547525405884
 40      },
 41      {
 42        "cfg": {
 43          "lr": 0.003,
 44          "wd": 0.0001
 45        },
 46        "mean": 13.136067628860474
 47      },
 48      {
 49        "cfg": {
 50          "lr": 0.003,
 51          "wd": 0.001
 52        },
 53        "mean": 13.114951848983765
 54      },
 55      {
 56        "cfg": {
 57          "lr": 0.006,
 58          "wd": 0.0
 59        },
 60        "mean": 9.905518293380737
 61      },
 62      {
 63        "cfg": {
 64          "lr": 0.006,
 65          "wd": 0.0001
 66        },
 67        "mean": 9.729963302612305
 68      },
 69      {
 70        "cfg": {
 71          "lr": 0.006,
 72          "wd": 0.001
 73        },
 74        "mean": 9.544940948486328
 75      }
 76    ],
 77    "full": {
 78      "mean": 9.642327845096588,
 79      "std": 1.047326484601666,
 80      "per_seed": [
 81        9.891983985900879,
 82        10.596479415893555,
 83        8.670082092285156,
 84        9.021218299865723,
 85        7.615931034088135,
 86        10.587333679199219,
 87        9.936084747314453,
 88        10.819509506225586
 89      ],
 90      "n": 8
 91    }
 92  },
 93  "idea": {
 94    "mean": 9.909327685832977,
 95    "std": 1.2741297958180666,
 96    "per_seed": [
 97      10.186660766601562,
 98      11.613065719604492,
 99      8.699080467224121,
100      9.08471965789795,
101      7.6164374351501465,
102      10.533278465270996,
103      10.165548324584961,
104      11.37583065032959
105    ],
106    "n": 8
107  },
108  "comparison": {
109    "delta_mean": 0.26699984073638916,
110    "idea_wins": 1,
111    "n_pairs": 8,
112    "per_seed_diffs": [
113      0.2946767807006836,
114      1.0165863037109375,
115      0.028998374938964844,
116      0.06350135803222656,
117      0.0005064010620117188,
118      -0.054055213928222656,
119      0.2294635772705078,
120      0.5563211441040039
121    ],
122    "p_value": 0.04035,
123    "mde": 0.30311716666322375,
124    "mde_rel_pct": 3.143609837093103,
125    "verdict": "idea worse (significant)",
126    "system_worked": false
127  },
128  "mechanism_signature": {
129    "track_choice": "tabular matches optimizer/regularizer ideas; shared MLP.",
130    "idea_grid": [
131      {
132        "cfg": {
133          "lr": 0.001,
134          "eps0": 0.0001,
135          "eps_min": 1e-06,
136          "decay": 0.7
137        },
138        "result": {
139          "mean": 18.25679302215576,
140          "std": 1.6583796998792717,
141          "per_seed": [
142            17.28780174255371,
143            17.48930549621582,
144            20.83658218383789,
145            15.395792007446289,
146            17.73833656311035,
147            17.7778263092041,
148            19.221439361572266,
149            20.307260513305664
150          ],
151          "n": 8
152        }
153      },
154      {
155        "cfg": {
156          "lr": 0.003,
157          "eps0": 0.001,
158          "eps_min": 1e-06,
159          "decay": 0.7
160        },
161        "result": {
162          "mean": 13.504453182220459,
163          "std": 1.1547149957425087,
164          "per_seed": [
165            13.25252914428711,
166            13.844292640686035,
167            13.66245174407959,
168            11.70921802520752,
169            12.26156234741211,
170            13.167490005493164,
171            14.4833984375,
172            15.654683113098145
173          ],
174          "n": 8
175        }
176      },
177      {
178        "cfg": {
179          "lr": 0.006,
180          "eps0": 0.01,
181          "eps_min": 1e-06,
182          "decay": 0.7
183        },
184        "result": {
185          "mean": 9.909327685832977,
186          "std": 1.2741297958180666,
187          "per_seed": [
188            10.186660766601562,
189            11.613065719604492,
190            8.699080467224121,
191            9.08471965789795,
192            7.6164374351501465,
193            10.533278465270996,
194            10.165548324584961,
195            11.37583065032959
196          ],
197          "n": 8
198        }
199      }
200    ],
201    "selected_idea_cfg": {
202      "lr": 0.006,
203      "eps0": 0.01,
204      "eps_min": 1e-06,
205      "decay": 0.7
206    },
207    "signature": {
208      "prediction": "damped CG residual <= 1e-5 max(1, ||b||) on trained network",
209      "predicted_max_residual": 0.0005065035629272461,
210      "observed_max_residual": 80.76493072509766,
211      "epsilon_pair_relative_change_norm_proxy": 0.0031547897960990667,
212      "trained_model_parameter_norm": 8.515052795410156,
213      "confirmed": false
214    }
215  }
216}