Adaptive Proximal Quasi-Newton Training / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "tabular",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.01,
10 "wd": 0.0
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "wd": 0.0
17 },
18 "mean": 14.000884532928467
19 },
20 {
21 "cfg": {
22 "lr": 0.001,
23 "wd": 0.0001
24 },
25 "mean": 13.928702116012573
26 },
27 {
28 "cfg": {
29 "lr": 0.001,
30 "wd": 0.001
31 },
32 "mean": 13.853612661361694
33 },
34 {
35 "cfg": {
36 "lr": 0.003,
37 "wd": 0.0
38 },
39 "mean": 7.579635977745056
40 },
41 {
42 "cfg": {
43 "lr": 0.003,
44 "wd": 0.0001
45 },
46 "mean": 7.295058488845825
47 },
48 {
49 "cfg": {
50 "lr": 0.003,
51 "wd": 0.001
52 },
53 "mean": 6.986483931541443
54 },
55 {
56 "cfg": {
57 "lr": 0.01,
58 "wd": 0.0
59 },
60 "mean": 6.920138120651245
61 },
62 {
63 "cfg": {
64 "lr": 0.01,
65 "wd": 0.0001
66 },
67 "mean": 6.949732184410095
68 },
69 {
70 "cfg": {
71 "lr": 0.01,
72 "wd": 0.001
73 },
74 "mean": 6.989647626876831
75 }
76 ],
77 "full": {
78 "mean": 6.9205562472343445,
79 "std": 0.5716103719461259,
80 "per_seed": [
81 7.096155643463135,
82 6.974558353424072,
83 6.666646480560303,
84 6.943192005157471,
85 5.7007622718811035,
86 7.199983596801758,
87 6.8888444900512695,
88 7.8943071365356445
89 ],
90 "n": 8
91 }
92 },
93 "idea": {
94 "mean": 7.772280991077423,
95 "std": 0.6641172020856825,
96 "per_seed": [
97 7.700952529907227,
98 7.535534381866455,
99 8.856191635131836,
100 6.979861736297607,
101 6.709100246429443,
102 7.994025707244873,
103 8.44301700592041,
104 7.959564685821533
105 ],
106 "n": 8,
107 "chosen_cfg": {
108 "lr": 0.003,
109 "lam": 1e-05,
110 "eta_up": 1.5
111 },
112 "sweep": [
113 {
114 "cfg": {
115 "lr": 0.001,
116 "lam": 1e-05,
117 "eta_up": 1.35
118 },
119 "mean": 8.174783706665039,
120 "per_seed": [
121 8.012105941772461,
122 8.44368839263916,
123 9.441221237182617,
124 7.554927825927734,
125 7.6160888671875,
126 8.013986587524414,
127 8.08622932434082,
128 8.230021476745605
129 ]
130 },
131 {
132 "cfg": {
133 "lr": 0.003,
134 "lam": 1e-05,
135 "eta_up": 1.5
136 },
137 "mean": 7.772280991077423,
138 "per_seed": [
139 7.700952529907227,
140 7.535534381866455,
141 8.856191635131836,
142 6.979861736297607,
143 6.709100246429443,
144 7.994025707244873,
145 8.44301700592041,
146 7.959564685821533
147 ]
148 },
149 {
150 "cfg": {
151 "lr": 0.01,
152 "lam": 1e-05,
153 "eta_up": 1.5
154 },
155 "mean": 7.991110026836395,
156 "per_seed": [
157 8.947175025939941,
158 7.837967872619629,
159 7.783258438110352,
160 7.059815406799316,
161 7.544052600860596,
162 7.272561073303223,
163 7.9431962966918945,
164 9.540853500366211
165 ]
166 }
167 ]
168 },
169 "comparison": {
170 "delta_mean": 0.8517247438430786,
171 "idea_wins": 0,
172 "n_pairs": 8,
173 "per_seed_diffs": [
174 0.6047968864440918,
175 0.5609760284423828,
176 2.189545154571533,
177 0.03666973114013672,
178 1.0083379745483398,
179 0.7940421104431152,
180 1.5541725158691406,
181 0.06525754928588867
182 ],
183 "p_value": 0.0081,
184 "mde": 0.611136711877834,
185 "mde_rel_pct": 8.830745536127418,
186 "verdict": "idea worse (significant)",
187 "system_worked": false
188 },
189 "mechanism_signature": {
190 "prediction": "adaptive eta should remain below local secant stability boundary 2/kappa",
191 "predicted_eta_c_from_trained_secants": 6.806255525998862e-09,
192 "observed_max_final_eta": 0.00043937891010204985,
193 "observed_median_eta": 0.0004584609905860991,
194 "accepted_mean": 124.25,
195 "rejected_mean": 25.75,
196 "confirmed": false
197 },
198 "notes": "Matched Friedman#1 regression and shared mlp_tiny; optimizer is the only intervention. Baseline AdamW sweep covers lr and weight decay."
199}