Bounded predictive-gain optimizer / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "tabular",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "wd": 0.0
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "wd": 0.0
17 },
18 "mean": 9.14509105682373
19 },
20 {
21 "cfg": {
22 "lr": 0.001,
23 "wd": 0.0001
24 },
25 "mean": 9.145180225372314
26 },
27 {
28 "cfg": {
29 "lr": 0.003,
30 "wd": 0.0
31 },
32 "mean": 6.927029252052307
33 },
34 {
35 "cfg": {
36 "lr": 0.003,
37 "wd": 0.0001
38 },
39 "mean": 6.927072286605835
40 },
41 {
42 "cfg": {
43 "lr": 0.006,
44 "wd": 0.0
45 },
46 "mean": 6.792275428771973
47 },
48 {
49 "cfg": {
50 "lr": 0.006,
51 "wd": 0.0001
52 },
53 "mean": 6.792290449142456
54 }
55 ],
56 "full": {
57 "mean": 7.667590081691742,
58 "std": 1.7205125356211413,
59 "per_seed": [
60 6.4639973640441895,
61 6.4978742599487305,
62 7.33742094039917,
63 6.869809150695801,
64 7.3997697830200195,
65 7.772507190704346,
66 6.91866397857666,
67 12.08067798614502
68 ],
69 "n": 8
70 }
71 },
72 "idea": {
73 "mean": 23.958279371261597,
74 "std": 3.6945581466806723,
75 "per_seed": [
76 21.538589477539062,
77 17.00618553161621,
78 25.721471786499023,
79 23.093345642089844,
80 27.321157455444336,
81 26.617502212524414,
82 29.042064666748047,
83 21.325918197631836
84 ],
85 "n": 8,
86 "selected_cfg": {
87 "lr": 0.003,
88 "gain_eta": 0.08,
89 "rho": 0.15
90 }
91 },
92 "comparison": {
93 "delta_mean": 16.290689289569855,
94 "idea_wins": 0,
95 "n_pairs": 8,
96 "per_seed_diffs": [
97 15.074592113494873,
98 10.50831127166748,
99 18.384050846099854,
100 16.223536491394043,
101 19.921387672424316,
102 18.84499502182007,
103 22.123400688171387,
104 9.245240211486816
105 ],
106 "p_value": 0.0081,
107 "mde": 3.7748401575264636,
108 "mde_rel_pct": 49.2311158696371,
109 "verdict": "idea worse (significant)",
110 "system_worked": false
111 },
112 "mechanism_signature": {
113 "trained_model_signature": {
114 "final_gains": [
115 0.008204753574549313,
116 0.007716603211568231,
117 0.03
118 ],
119 "clip_frequency": 1.0234375,
120 "gradient_reversal_frequency": 1.1484375,
121 "history": [
122 30.83193588256836,
123 12.97095012664795,
124 19.285388946533203,
125 27.07645034790039,
126 22.369277954101562,
127 35.104671478271484,
128 20.543949127197266,
129 27.519351959228516
130 ],
131 "predicted_delta_mean": 0.27506878502578563,
132 "observed_delta_mean": 4.82632114851212e-05,
133 "predicted_delta_slope": -7.362199623823305e-05,
134 "observed_delta_slope": -7.362199623823305e-05,
135 "n_updates": 765,
136 "confirmed": false,
137 "math_prediction": "gain change approximately eta*dot/(1+rho), measured on trained tabular MLP",
138 "math_check": {
139 "prediction": "delta_gain=eta*r*g^2/(1+rho) at gain=reference",
140 "predicted_slope": 0.08450000000000002,
141 "observed_slope": 0.08450000000000005,
142 "max_abs_error": 1.1102230246251565e-16,
143 "pass": true
144 },
145 "idea_cfg": {
146 "lr": 0.003,
147 "gain_eta": 0.08,
148 "rho": 0.15
149 }
150 },
151 "idea_grid": [
152 {
153 "cfg": {
154 "lr": 0.006,
155 "gain_eta": 0.08,
156 "rho": 0.15
157 },
158 "mean": 34.99524688720703
159 },
160 {
161 "cfg": {
162 "lr": 0.003,
163 "gain_eta": 0.08,
164 "rho": 0.15
165 },
166 "mean": 23.958279371261597
167 },
168 {
169 "cfg": {
170 "lr": 0.006,
171 "gain_eta": 0.08,
172 "rho": 0.15
173 },
174 "mean": 34.99524688720703
175 }
176 ]
177 },
178 "math_check": {
179 "prediction": "delta_gain=eta*r*g^2/(1+rho) at gain=reference",
180 "predicted_slope": 0.08450000000000002,
181 "observed_slope": 0.08450000000000005,
182 "max_abs_error": 1.1102230246251565e-16,
183 "pass": true
184 }
185}