Transverse Synchrony Training / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.01,
10 "epochs": 10,
11 "k": 0.0
12 },
13 "sweep": [
14 {
15 "cfg": {
16 "lr": 0.001,
17 "epochs": 10,
18 "k": 0.0
19 },
20 "result": {
21 "mean": 0.18850252870470285,
22 "std": 0.09844521870499254,
23 "per_seed": [
24 0.2647189795970917,
25 0.2680639326572418,
26 0.05886165052652359,
27 0.11395366489887238,
28 0.17393222451210022,
29 0.36622312664985657,
30 0.08291985094547272,
31 0.17934679985046387
32 ],
33 "n": 8
34 }
35 },
36 {
37 "cfg": {
38 "lr": 0.003,
39 "epochs": 10,
40 "k": 0.0
41 },
42 "result": {
43 "mean": 0.010191879409831017,
44 "std": 0.004210917599331909,
45 "per_seed": [
46 0.005354649852961302,
47 0.005063467659056187,
48 0.012440202757716179,
49 0.017969045788049698,
50 0.01297833863645792,
51 0.007027691230177879,
52 0.012447123415768147,
53 0.008254515938460827
54 ],
55 "n": 8
56 }
57 },
58 {
59 "cfg": {
60 "lr": 0.01,
61 "epochs": 10,
62 "k": 0.0
63 },
64 "result": {
65 "mean": 0.003416259671212174,
66 "std": 0.0007808474461952083,
67 "per_seed": [
68 0.0038322454784065485,
69 0.003838583827018738,
70 0.004478443879634142,
71 0.0032678311690688133,
72 0.003483000909909606,
73 0.0030872197821736336,
74 0.0016336649423465133,
75 0.0037090873811393976
76 ],
77 "n": 8
78 }
79 }
80 ],
81 "harness_tuning": {
82 "best_cfg": {
83 "lr": 0.01,
84 "epochs": 10,
85 "k": 0.0
86 },
87 "sweep": [
88 {
89 "cfg": {
90 "lr": 0.001,
91 "epochs": 10,
92 "k": 0.0
93 },
94 "mean": 0.17639955691993237
95 },
96 {
97 "cfg": {
98 "lr": 0.003,
99 "epochs": 10,
100 "k": 0.0
101 },
102 "mean": 0.010206841514445841
103 },
104 {
105 "cfg": {
106 "lr": 0.01,
107 "epochs": 10,
108 "k": 0.0
109 },
110 "mean": 0.0038542760885320604
111 }
112 ],
113 "full": {
114 "mean": 0.003416259671212174,
115 "std": 0.0007808474461952083,
116 "per_seed": [
117 0.0038322454784065485,
118 0.003838583827018738,
119 0.004478443879634142,
120 0.0032678311690688133,
121 0.003483000909909606,
122 0.0030872197821736336,
123 0.0016336649423465133,
124 0.0037090873811393976
125 ],
126 "n": 8
127 }
128 },
129 "full": {
130 "mean": 0.003416259671212174,
131 "std": 0.0007808474461952083,
132 "per_seed": [
133 0.0038322454784065485,
134 0.003838583827018738,
135 0.004478443879634142,
136 0.0032678311690688133,
137 0.003483000909909606,
138 0.0030872197821736336,
139 0.0016336649423465133,
140 0.0037090873811393976
141 ],
142 "n": 8
143 }
144 },
145 "idea": {
146 "mean": 0.002392302827502135,
147 "std": 0.0015345376265231531,
148 "per_seed": [
149 0.0014558794209733605,
150 0.002402462065219879,
151 0.0027061353903263807,
152 0.001609530416317284,
153 0.0019438277231529355,
154 0.0027547706849873066,
155 0.0003203718806616962,
156 0.005945445038378239
157 ],
158 "n": 8
159 },
160 "comparison": {
161 "delta_mean": -0.0010239568437100388,
162 "idea_wins": 7,
163 "n_pairs": 8,
164 "per_seed_diffs": [
165 -0.002376366057433188,
166 -0.0014361217617988586,
167 -0.0017723084893077612,
168 -0.0016583007527515292,
169 -0.0015391731867566705,
170 -0.000332449097186327,
171 -0.001313293061684817,
172 0.002236357657238841
173 ],
174 "p_value": 0.1057,
175 "mde": 0.0012000360968298309,
176 "mde_rel_pct": 35.12719208502169,
177 "verdict": "no significant win",
178 "system_worked": false
179 },
180 "mechanism_signature": {
181 "math_check": {
182 "predicted_boundary": 0.1499999999999999,
183 "observed_boundary": 0.1499999999999999,
184 "max_abs_slope_error": 1.1102230246251565e-16,
185 "passed": true
186 },
187 "idea_sweep": [
188 {
189 "cfg": {
190 "lr": 0.001,
191 "epochs": 10,
192 "k": 0.05
193 },
194 "result": {
195 "mean": 0.22941934876143932,
196 "std": 0.10325000200323692,
197 "per_seed": [
198 0.29764461517333984,
199 0.26714083552360535,
200 0.0848923772573471,
201 0.19724982976913452,
202 0.210689976811409,
203 0.4287005066871643,
204 0.09971201419830322,
205 0.24932463467121124
206 ],
207 "n": 8
208 }
209 },
210 {
211 "cfg": {
212 "lr": 0.003,
213 "epochs": 10,
214 "k": 0.1
215 },
216 "result": {
217 "mean": 0.010696535755414516,
218 "std": 0.004646521743264224,
219 "per_seed": [
220 0.003972996026277542,
221 0.006377296522259712,
222 0.015556089580059052,
223 0.014911942183971405,
224 0.009622597135603428,
225 0.01697155274450779,
226 0.005784574430435896,
227 0.012375237420201302
228 ],
229 "n": 8
230 }
231 },
232 {
233 "cfg": {
234 "lr": 0.01,
235 "epochs": 10,
236 "k": 0.2
237 },
238 "result": {
239 "mean": 0.002392302827502135,
240 "std": 0.0015345376265231531,
241 "per_seed": [
242 0.0014558794209733605,
243 0.002402462065219879,
244 0.0027061353903263807,
245 0.001609530416317284,
246 0.0019438277231529355,
247 0.0027547706849873066,
248 0.0003203718806616962,
249 0.005945445038378239
250 ],
251 "n": 8
252 }
253 }
254 ],
255 "mechanism_signature": {
256 "prediction": "positive coupling should reduce latent synchrony residuals; transverse map has multiplier near 1-k",
257 "trained_test_mse": 0.0014558794209733605,
258 "observed_residual_start": 0.8435457944869995,
259 "observed_residual_final": 2.192122459411621,
260 "observed_residual_ratio": 2.5987000038831995,
261 "observed_input_output_jacobian": 0.40619704127311707,
262 "confirmed": false
263 }
264 },
265 "protocol_notes": "Matched built-in actuated-pendulum dynamics track; both systems use the same GRUCell/head and lr union, with only reference coupling and synchrony loss added for the idea."
266}