Variance-aware gradient reduction trees / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "tabular",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "epochs": 12
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "epochs": 12
17 },
18 "mean": 130.1314926147461
19 },
20 {
21 "cfg": {
22 "lr": 0.003,
23 "epochs": 12
24 },
25 "mean": 17.59502100944519
26 },
27 {
28 "cfg": {
29 "lr": 0.006,
30 "epochs": 12
31 },
32 "mean": 13.973259925842285
33 }
34 ],
35 "full": {
36 "mean": 14.809300541877747,
37 "std": 2.0570786187742542,
38 "per_seed": [
39 14.058874130249023,
40 15.062494277954102,
41 13.770842552185059,
42 13.000828742980957,
43 12.002371788024902,
44 15.041543960571289,
45 16.459678649902344,
46 19.077770233154297
47 ],
48 "n": 8
49 }
50 },
51 "idea": {
52 "mean": 14.809300541877747,
53 "std": 2.0570786187742542,
54 "per_seed": [
55 14.058874130249023,
56 15.062494277954102,
57 13.770842552185059,
58 13.000828742980957,
59 12.002371788024902,
60 15.041543960571289,
61 16.459678649902344,
62 19.077770233154297
63 ],
64 "n": 8,
65 "best_cfg": {
66 "lr": 0.006,
67 "epochs": 12
68 },
69 "sweep": [
70 {
71 "cfg": {
72 "lr": 0.001,
73 "epochs": 12
74 },
75 "mean": 130.1314926147461
76 },
77 {
78 "cfg": {
79 "lr": 0.003,
80 "epochs": 12
81 },
82 "mean": 17.59502100944519
83 },
84 {
85 "cfg": {
86 "lr": 0.006,
87 "epochs": 12
88 },
89 "mean": 13.973259925842285
90 }
91 ]
92 },
93 "comparison": {
94 "delta_mean": 0.0,
95 "idea_wins": 0,
96 "n_pairs": 8,
97 "per_seed_diffs": [
98 0.0,
99 0.0,
100 0.0,
101 0.0,
102 0.0,
103 0.0,
104 0.0,
105 0.0
106 ],
107 "p_value": 1.0,
108 "mde": 0.0,
109 "mde_rel_pct": 0.0,
110 "verdict": "no measurable effect",
111 "system_worked": false
112 },
113 "mechanism_signature": {
114 "idea_sweep": [
115 {
116 "cfg": {
117 "lr": 0.001,
118 "epochs": 12
119 },
120 "mean": 130.1314926147461
121 },
122 {
123 "cfg": {
124 "lr": 0.003,
125 "epochs": 12
126 },
127 "mean": 17.59502100944519
128 },
129 {
130 "cfg": {
131 "lr": 0.006,
132 "epochs": 12
133 },
134 "mean": 13.973259925842285
135 }
136 ],
137 "mechanism_signature": {
138 "predicted": "high-variance chunks have shallower Huffman depth",
139 "observed_mean_min_depth": 1.0,
140 "balanced_depth": 3,
141 "trained_model_measurements": [
142 {
143 "0": 2,
144 "4": 5,
145 "6": 6,
146 "5": 6,
147 "3": 5,
148 "2": 5,
149 "1": 3,
150 "7": 1
151 },
152 {
153 "0": 2,
154 "1": 3,
155 "6": 5,
156 "2": 5,
157 "5": 5,
158 "3": 6,
159 "4": 6,
160 "7": 1
161 },
162 {
163 "6": 5,
164 "5": 5,
165 "3": 5,
166 "4": 6,
167 "2": 6,
168 "1": 3,
169 "0": 2,
170 "7": 1
171 },
172 {
173 "0": 2,
174 "1": 3,
175 "3": 5,
176 "5": 6,
177 "6": 6,
178 "4": 5,
179 "2": 5,
180 "7": 1
181 },
182 {
183 "0": 2,
184 "1": 3,
185 "3": 5,
186 "2": 5,
187 "4": 6,
188 "5": 6,
189 "6": 5,
190 "7": 1
191 },
192 {
193 "2": 5,
194 "3": 5,
195 "6": 6,
196 "4": 6,
197 "5": 5,
198 "1": 3,
199 "0": 2,
200 "7": 1
201 },
202 {
203 "0": 2,
204 "4": 5,
205 "5": 5,
206 "3": 4,
207 "2": 5,
208 "6": 5,
209 "1": 4,
210 "7": 1
211 },
212 {
213 "1": 3,
214 "4": 5,
215 "3": 5,
216 "5": 5,
217 "2": 6,
218 "6": 6,
219 "0": 2,
220 "7": 1
221 }
222 ],
223 "observed_reduction_mse_mean": 1.0762555611452634e-07,
224 "confirmed": true
225 }
226 }
227}