Bounded predictive-gain optimizer / run_output.json
Failed on benchmark
1{
2 "math_check": {
3 "prediction": "delta_gain=eta*r*g^2/(1+rho) at gain=reference",
4 "predicted_slope": 0.08450000000000002,
5 "observed_slope": 0.08450000000000005,
6 "max_abs_error": 1.1102230246251565e-16,
7 "pass": true
8 }
9}
10{
11 "bench_version": 1,
12 "track": "tabular",
13 "model": "mlp_tiny",
14 "metric_direction": "lower is better",
15 "n_seeds": 8,
16 "baseline": {
17 "best_cfg": {
18 "lr": 0.006,
19 "wd": 0.0
20 },
21 "sweep": [
22 {
23 "cfg": {
24 "lr": 0.001,
25 "wd": 0.0
26 },
27 "mean": 9.14509105682373
28 },
29 {
30 "cfg": {
31 "lr": 0.001,
32 "wd": 0.0001
33 },
34 "mean": 9.145180225372314
35 },
36 {
37 "cfg": {
38 "lr": 0.003,
39 "wd": 0.0
40 },
41 "mean": 6.927029252052307
42 },
43 {
44 "cfg": {
45 "lr": 0.003,
46 "wd": 0.0001
47 },
48 "mean": 6.927072286605835
49 },
50 {
51 "cfg": {
52 "lr": 0.006,
53 "wd": 0.0
54 },
55 "mean": 6.792275428771973
56 },
57 {
58 "cfg": {
59 "lr": 0.006,
60 "wd": 0.0001
61 },
62 "mean": 6.792290449142456
63 }
64 ],
65 "full": {
66 "mean": 7.667590081691742,
67 "std": 1.7205125356211413,
68 "per_seed": [
69 6.4639973640441895,
70 6.4978742599487305,
71 7.33742094039917,
72 6.869809150695801,
73 7.3997697830200195,
74 7.772507190704346,
75 6.91866397857666,
76 12.08067798614502
77 ],
78 "n": 8
79 }
80 },
81 "idea": {
82 "mean": 23.958279371261597,
83 "std": 3.6945581466806723,
84 "per_seed": [
85 21.538589477539062,
86 17.00618553161621,
87 25.721471786499023,
88 23.093345642089844,
89 27.321157455444336,
90 26.617502212524414,
91 29.042064666748047,
92 21.325918197631836
93 ],
94 "n": 8,
95 "selected_cfg": {
96 "lr": 0.003,
97 "gain_eta": 0.08,
98 "rho": 0.15
99 }
100 },
101 "comparison": {
102 "delta_mean": 16.290689289569855,
103 "idea_wins": 0,
104 "n_pairs": 8,
105 "per_seed_diffs": [
106 15.074592113494873,
107 10.50831127166748,
108 18.384050846099854,
109 16.223536491394043,
110 19.921387672424316,
111 18.84499502182007,
112 22.123400688171387,
113 9.245240211486816
114 ],
115 "p_value": 0.0081,
116 "mde": 3.7748401575264636,
117 "mde_rel_pct": 49.2311158696371,
118 "verdict": "idea worse (significant)",
119 "system_worked": false
120 },
121 "mechanism_signature": {
122 "trained_model_signature": {
123 "final_gains": [
124 0.008204753574549313,
125 0.007716603211568231,
126 0.03
127 ],
128 "clip_frequency": 1.0234375,
129 "gradient_reversal_frequency": 1.1484375,
130 "history": [
131 30.83193588256836,
132 12.97095012664795,
133 19.285388946533203,
134 27.07645034790039,
135 22.369277954101562,
136 35.104671478271484,
137 20.543949127197266,
138 27.519351959228516
139 ],
140 "predicted_delta_mean": 0.27506878502578563,
141 "observed_delta_mean": 4.82632114851212e-05,
142 "predicted_delta_slope": -7.362199623823305e-05,
143 "observed_delta_slope": -7.362199623823305e-05,
144 "n_updates": 765,
145 "confirmed": false,
146 "math_prediction": "gain change approximately eta*dot/(1+rho), measured on trained tabular MLP",
147 "math_check": {
148 "prediction": "delta_gain=eta*r*g^2/(1+rho) at gain=reference",
149 "predicted_slope": 0.08450000000000002,
150 "observed_slope": 0.08450000000000005,
151 "max_abs_error": 1.1102230246251565e-16,
152 "pass": true
153 },
154 "idea_cfg": {
155 "lr": 0.003,
156 "gain_eta": 0.08,
157 "rho": 0.15
158 }
159 },
160 "idea_grid": [
161 {
162 "cfg": {
163 "lr": 0.006,
164 "gain_eta": 0.08,
165 "rho": 0.15
166 },
167 "mean": 34.99524688720703
168 },
169 {
170 "cfg": {
171 "lr": 0.003,
172 "gain_eta": 0.08,
173 "rho": 0.15
174 },
175 "mean": 23.958279371261597
176 },
177 {
178 "cfg": {
179 "lr": 0.006,
180 "gain_eta": 0.08,
181 "rho": 0.15
182 },
183 "mean": 34.99524688720703
184 }
185 ]
186 },
187 "math_check": {
188 "prediction": "delta_gain=eta*r*g^2/(1+rho) at gain=reference",
189 "predicted_slope": 0.08450000000000002,
190 "observed_slope": 0.08450000000000005,
191 "max_abs_error": 1.1102230246251565e-16,
192 "pass": true
193 }
194}