Adaptive Proximal Quasi-Newton Training / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01,
 10      "wd": 0.0
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "wd": 0.0
 17        },
 18        "mean": 14.000884532928467
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.001,
 23          "wd": 0.0001
 24        },
 25        "mean": 13.928702116012573
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.001,
 30          "wd": 0.001
 31        },
 32        "mean": 13.853612661361694
 33      },
 34      {
 35        "cfg": {
 36          "lr": 0.003,
 37          "wd": 0.0
 38        },
 39        "mean": 7.579635977745056
 40      },
 41      {
 42        "cfg": {
 43          "lr": 0.003,
 44          "wd": 0.0001
 45        },
 46        "mean": 7.295058488845825
 47      },
 48      {
 49        "cfg": {
 50          "lr": 0.003,
 51          "wd": 0.001
 52        },
 53        "mean": 6.986483931541443
 54      },
 55      {
 56        "cfg": {
 57          "lr": 0.01,
 58          "wd": 0.0
 59        },
 60        "mean": 6.920138120651245
 61      },
 62      {
 63        "cfg": {
 64          "lr": 0.01,
 65          "wd": 0.0001
 66        },
 67        "mean": 6.949732184410095
 68      },
 69      {
 70        "cfg": {
 71          "lr": 0.01,
 72          "wd": 0.001
 73        },
 74        "mean": 6.989647626876831
 75      }
 76    ],
 77    "full": {
 78      "mean": 6.9205562472343445,
 79      "std": 0.5716103719461259,
 80      "per_seed": [
 81        7.096155643463135,
 82        6.974558353424072,
 83        6.666646480560303,
 84        6.943192005157471,
 85        5.7007622718811035,
 86        7.199983596801758,
 87        6.8888444900512695,
 88        7.8943071365356445
 89      ],
 90      "n": 8
 91    }
 92  },
 93  "idea": {
 94    "mean": 7.772280991077423,
 95    "std": 0.6641172020856825,
 96    "per_seed": [
 97      7.700952529907227,
 98      7.535534381866455,
 99      8.856191635131836,
100      6.979861736297607,
101      6.709100246429443,
102      7.994025707244873,
103      8.44301700592041,
104      7.959564685821533
105    ],
106    "n": 8,
107    "chosen_cfg": {
108      "lr": 0.003,
109      "lam": 1e-05,
110      "eta_up": 1.5
111    },
112    "sweep": [
113      {
114        "cfg": {
115          "lr": 0.001,
116          "lam": 1e-05,
117          "eta_up": 1.35
118        },
119        "mean": 8.174783706665039,
120        "per_seed": [
121          8.012105941772461,
122          8.44368839263916,
123          9.441221237182617,
124          7.554927825927734,
125          7.6160888671875,
126          8.013986587524414,
127          8.08622932434082,
128          8.230021476745605
129        ]
130      },
131      {
132        "cfg": {
133          "lr": 0.003,
134          "lam": 1e-05,
135          "eta_up": 1.5
136        },
137        "mean": 7.772280991077423,
138        "per_seed": [
139          7.700952529907227,
140          7.535534381866455,
141          8.856191635131836,
142          6.979861736297607,
143          6.709100246429443,
144          7.994025707244873,
145          8.44301700592041,
146          7.959564685821533
147        ]
148      },
149      {
150        "cfg": {
151          "lr": 0.01,
152          "lam": 1e-05,
153          "eta_up": 1.5
154        },
155        "mean": 7.991110026836395,
156        "per_seed": [
157          8.947175025939941,
158          7.837967872619629,
159          7.783258438110352,
160          7.059815406799316,
161          7.544052600860596,
162          7.272561073303223,
163          7.9431962966918945,
164          9.540853500366211
165        ]
166      }
167    ]
168  },
169  "comparison": {
170    "delta_mean": 0.8517247438430786,
171    "idea_wins": 0,
172    "n_pairs": 8,
173    "per_seed_diffs": [
174      0.6047968864440918,
175      0.5609760284423828,
176      2.189545154571533,
177      0.03666973114013672,
178      1.0083379745483398,
179      0.7940421104431152,
180      1.5541725158691406,
181      0.06525754928588867
182    ],
183    "p_value": 0.0081,
184    "mde": 0.611136711877834,
185    "mde_rel_pct": 8.830745536127418,
186    "verdict": "idea worse (significant)",
187    "system_worked": false
188  },
189  "mechanism_signature": {
190    "prediction": "adaptive eta should remain below local secant stability boundary 2/kappa",
191    "predicted_eta_c_from_trained_secants": 6.806255525998862e-09,
192    "observed_max_final_eta": 0.00043937891010204985,
193    "observed_median_eta": 0.0004584609905860991,
194    "accepted_mean": 124.25,
195    "rejected_mean": 25.75,
196    "confirmed": false
197  },
198  "notes": "Matched Friedman#1 regression and shared mlp_tiny; optimizer is the only intervention. Baseline AdamW sweep covers lr and weight decay."
199}