Transverse Synchrony Training / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01,
 10      "epochs": 10,
 11      "k": 0.0
 12    },
 13    "sweep": [
 14      {
 15        "cfg": {
 16          "lr": 0.001,
 17          "epochs": 10,
 18          "k": 0.0
 19        },
 20        "result": {
 21          "mean": 0.18850252870470285,
 22          "std": 0.09844521870499254,
 23          "per_seed": [
 24            0.2647189795970917,
 25            0.2680639326572418,
 26            0.05886165052652359,
 27            0.11395366489887238,
 28            0.17393222451210022,
 29            0.36622312664985657,
 30            0.08291985094547272,
 31            0.17934679985046387
 32          ],
 33          "n": 8
 34        }
 35      },
 36      {
 37        "cfg": {
 38          "lr": 0.003,
 39          "epochs": 10,
 40          "k": 0.0
 41        },
 42        "result": {
 43          "mean": 0.010191879409831017,
 44          "std": 0.004210917599331909,
 45          "per_seed": [
 46            0.005354649852961302,
 47            0.005063467659056187,
 48            0.012440202757716179,
 49            0.017969045788049698,
 50            0.01297833863645792,
 51            0.007027691230177879,
 52            0.012447123415768147,
 53            0.008254515938460827
 54          ],
 55          "n": 8
 56        }
 57      },
 58      {
 59        "cfg": {
 60          "lr": 0.01,
 61          "epochs": 10,
 62          "k": 0.0
 63        },
 64        "result": {
 65          "mean": 0.003416259671212174,
 66          "std": 0.0007808474461952083,
 67          "per_seed": [
 68            0.0038322454784065485,
 69            0.003838583827018738,
 70            0.004478443879634142,
 71            0.0032678311690688133,
 72            0.003483000909909606,
 73            0.0030872197821736336,
 74            0.0016336649423465133,
 75            0.0037090873811393976
 76          ],
 77          "n": 8
 78        }
 79      }
 80    ],
 81    "harness_tuning": {
 82      "best_cfg": {
 83        "lr": 0.01,
 84        "epochs": 10,
 85        "k": 0.0
 86      },
 87      "sweep": [
 88        {
 89          "cfg": {
 90            "lr": 0.001,
 91            "epochs": 10,
 92            "k": 0.0
 93          },
 94          "mean": 0.17639955691993237
 95        },
 96        {
 97          "cfg": {
 98            "lr": 0.003,
 99            "epochs": 10,
100            "k": 0.0
101          },
102          "mean": 0.010206841514445841
103        },
104        {
105          "cfg": {
106            "lr": 0.01,
107            "epochs": 10,
108            "k": 0.0
109          },
110          "mean": 0.0038542760885320604
111        }
112      ],
113      "full": {
114        "mean": 0.003416259671212174,
115        "std": 0.0007808474461952083,
116        "per_seed": [
117          0.0038322454784065485,
118          0.003838583827018738,
119          0.004478443879634142,
120          0.0032678311690688133,
121          0.003483000909909606,
122          0.0030872197821736336,
123          0.0016336649423465133,
124          0.0037090873811393976
125        ],
126        "n": 8
127      }
128    },
129    "full": {
130      "mean": 0.003416259671212174,
131      "std": 0.0007808474461952083,
132      "per_seed": [
133        0.0038322454784065485,
134        0.003838583827018738,
135        0.004478443879634142,
136        0.0032678311690688133,
137        0.003483000909909606,
138        0.0030872197821736336,
139        0.0016336649423465133,
140        0.0037090873811393976
141      ],
142      "n": 8
143    }
144  },
145  "idea": {
146    "mean": 0.002392302827502135,
147    "std": 0.0015345376265231531,
148    "per_seed": [
149      0.0014558794209733605,
150      0.002402462065219879,
151      0.0027061353903263807,
152      0.001609530416317284,
153      0.0019438277231529355,
154      0.0027547706849873066,
155      0.0003203718806616962,
156      0.005945445038378239
157    ],
158    "n": 8
159  },
160  "comparison": {
161    "delta_mean": -0.0010239568437100388,
162    "idea_wins": 7,
163    "n_pairs": 8,
164    "per_seed_diffs": [
165      -0.002376366057433188,
166      -0.0014361217617988586,
167      -0.0017723084893077612,
168      -0.0016583007527515292,
169      -0.0015391731867566705,
170      -0.000332449097186327,
171      -0.001313293061684817,
172      0.002236357657238841
173    ],
174    "p_value": 0.1057,
175    "mde": 0.0012000360968298309,
176    "mde_rel_pct": 35.12719208502169,
177    "verdict": "no significant win",
178    "system_worked": false
179  },
180  "mechanism_signature": {
181    "math_check": {
182      "predicted_boundary": 0.1499999999999999,
183      "observed_boundary": 0.1499999999999999,
184      "max_abs_slope_error": 1.1102230246251565e-16,
185      "passed": true
186    },
187    "idea_sweep": [
188      {
189        "cfg": {
190          "lr": 0.001,
191          "epochs": 10,
192          "k": 0.05
193        },
194        "result": {
195          "mean": 0.22941934876143932,
196          "std": 0.10325000200323692,
197          "per_seed": [
198            0.29764461517333984,
199            0.26714083552360535,
200            0.0848923772573471,
201            0.19724982976913452,
202            0.210689976811409,
203            0.4287005066871643,
204            0.09971201419830322,
205            0.24932463467121124
206          ],
207          "n": 8
208        }
209      },
210      {
211        "cfg": {
212          "lr": 0.003,
213          "epochs": 10,
214          "k": 0.1
215        },
216        "result": {
217          "mean": 0.010696535755414516,
218          "std": 0.004646521743264224,
219          "per_seed": [
220            0.003972996026277542,
221            0.006377296522259712,
222            0.015556089580059052,
223            0.014911942183971405,
224            0.009622597135603428,
225            0.01697155274450779,
226            0.005784574430435896,
227            0.012375237420201302
228          ],
229          "n": 8
230        }
231      },
232      {
233        "cfg": {
234          "lr": 0.01,
235          "epochs": 10,
236          "k": 0.2
237        },
238        "result": {
239          "mean": 0.002392302827502135,
240          "std": 0.0015345376265231531,
241          "per_seed": [
242            0.0014558794209733605,
243            0.002402462065219879,
244            0.0027061353903263807,
245            0.001609530416317284,
246            0.0019438277231529355,
247            0.0027547706849873066,
248            0.0003203718806616962,
249            0.005945445038378239
250          ],
251          "n": 8
252        }
253      }
254    ],
255    "mechanism_signature": {
256      "prediction": "positive coupling should reduce latent synchrony residuals; transverse map has multiplier near 1-k",
257      "trained_test_mse": 0.0014558794209733605,
258      "observed_residual_start": 0.8435457944869995,
259      "observed_residual_final": 2.192122459411621,
260      "observed_residual_ratio": 2.5987000038831995,
261      "observed_input_output_jacobian": 0.40619704127311707,
262      "confirmed": false
263    }
264  },
265  "protocol_notes": "Matched built-in actuated-pendulum dynamics track; both systems use the same GRUCell/head and lr union, with only reference coupling and synchrony loss added for the idea."
266}