Delay-Robust Slow Consensus Optimizer / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "tabular",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.01,
10 "k": 0.0,
11 "delay": 0
12 },
13 "sweep": [
14 {
15 "cfg": {
16 "lr": 0.001,
17 "k": 0.0,
18 "delay": 0
19 },
20 "mean": 26.43767786026001
21 },
22 {
23 "cfg": {
24 "lr": 0.003,
25 "k": 0.0,
26 "delay": 0
27 },
28 "mean": 13.834030151367188
29 },
30 {
31 "cfg": {
32 "lr": 0.01,
33 "k": 0.0,
34 "delay": 0
35 },
36 "mean": 8.090400218963623
37 }
38 ],
39 "full": {
40 "mean": 8.471371114253998,
41 "std": 0.789625392148929,
42 "per_seed": [
43 7.42649507522583,
44 8.836640357971191,
45 7.776073932647705,
46 8.322391510009766,
47 7.539560794830322,
48 8.821172714233398,
49 9.681197166442871,
50 9.367437362670898
51 ],
52 "n": 8
53 }
54 },
55 "idea": {
56 "mean": 15.51313579082489,
57 "std": 0.7923130595085129,
58 "per_seed": [
59 14.976237297058105,
60 14.776838302612305,
61 16.32500648498535,
62 14.312763214111328,
63 15.06303882598877,
64 16.302553176879883,
65 15.731860160827637,
66 16.616788864135742
67 ],
68 "n": 8
69 },
70 "comparison": {
71 "delta_mean": 7.041764676570892,
72 "idea_wins": 0,
73 "n_pairs": 8,
74 "per_seed_diffs": [
75 7.549742221832275,
76 5.940197944641113,
77 8.548932552337646,
78 5.9903717041015625,
79 7.523478031158447,
80 7.481380462646484,
81 6.050662994384766,
82 7.249351501464844
83 ],
84 "p_value": 0.0081,
85 "mde": 0.793192058324816,
86 "mde_rel_pct": 9.363207533077905,
87 "verdict": "idea worse (significant)",
88 "system_worked": false
89 },
90 "mechanism_signature": {
91 "track_structure": "optimizer on heterogeneous disjoint-worker tabular training",
92 "config": {
93 "lr": 0.003,
94 "k": 0.02,
95 "delay": 0
96 },
97 "predicted_slowdown": 1.0,
98 "observed_collective_step_ratio": 0.3575581591576338,
99 "relative_error": 0.6424418408423662,
100 "final_disagreement": 9.698813028080622e-05,
101 "confirmed": false
102 },
103 "idea_sweep": [
104 {
105 "cfg": {
106 "lr": 0.003,
107 "k": 0.02,
108 "delay": 0
109 },
110 "result": {
111 "mean": 15.51313579082489,
112 "std": 0.7923130595085129,
113 "per_seed": [
114 14.976237297058105,
115 14.776838302612305,
116 16.32500648498535,
117 14.312763214111328,
118 15.06303882598877,
119 16.302553176879883,
120 15.731860160827637,
121 16.616788864135742
122 ],
123 "n": 8
124 }
125 },
126 {
127 "cfg": {
128 "lr": 0.003,
129 "k": 0.02,
130 "delay": 2
131 },
132 "result": {
133 "mean": 15.614838361740112,
134 "std": 0.8421123200541285,
135 "per_seed": [
136 15.206962585449219,
137 14.785978317260742,
138 16.650211334228516,
139 14.41156005859375,
140 14.992582321166992,
141 16.48356819152832,
142 15.700258255004883,
143 16.687585830688477
144 ],
145 "n": 8
146 }
147 },
148 {
149 "cfg": {
150 "lr": 0.003,
151 "k": 0.02,
152 "delay": 5
153 },
154 "result": {
155 "mean": 15.973463654518127,
156 "std": 0.9573226631534311,
157 "per_seed": [
158 16.243694305419922,
159 14.805825233459473,
160 16.784862518310547,
161 14.326708793640137,
162 15.480900764465332,
163 16.745159149169922,
164 16.138805389404297,
165 17.26175308227539
166 ],
167 "n": 8
168 }
169 }
170 ],
171 "protocol_notes": {
172 "architecture_match": true,
173 "baseline": "independent local Adam replicas, ensemble prediction",
174 "n_train": 800,
175 "epochs": 18,
176 "workers": 4,
177 "lr_union": [
178 0.001,
179 0.003,
180 0.01
181 ]
182 }
183}