Directed-Path Synchronization Coupling / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "eta": 0.0
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.0015,
 16          "eta": 0.0
 17        },
 18        "mean": 0.13071522302925587
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "eta": 0.0
 24        },
 25        "mean": 0.01457755290903151
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.006,
 30          "eta": 0.0
 31        },
 32        "mean": 0.006850881385616958
 33      }
 34    ],
 35    "full": {
 36      "mean": 0.006962434679735452,
 37      "std": 0.0022827002771013453,
 38      "per_seed": [
 39        0.007542507257312536,
 40        0.00671812891960144,
 41        0.006612597499042749,
 42        0.0065302918665111065,
 43        0.003842386417090893,
 44        0.005645386874675751,
 45        0.006438639014959335,
 46        0.012369539588689804
 47      ],
 48      "n": 8
 49    }
 50  },
 51  "idea": {
 52    "mean": 0.007029922096990049,
 53    "std": 0.002205360988149756,
 54    "per_seed": [
 55      0.007741106674075127,
 56      0.006892496719956398,
 57      0.006658521946519613,
 58      0.0070778545923531055,
 59      0.0037982785142958164,
 60      0.005655689164996147,
 61      0.0063418434001505375,
 62      0.012073585763573647
 63    ],
 64    "n": 8
 65  },
 66  "comparison": {
 67    "delta_mean": 6.748741725459695e-05,
 68    "idea_wins": 3,
 69    "n_pairs": 8,
 70    "per_seed_diffs": [
 71      0.0001985994167625904,
 72      0.00017436780035495758,
 73      4.592444747686386e-05,
 74      0.000547562725841999,
 75      -4.410790279507637e-05,
 76      1.0302290320396423e-05,
 77      -9.679561480879784e-05,
 78      -0.00029595382511615753
 79    ],
 80    "p_value": 0.51155,
 81    "mde": 0.0002082852976156794,
 82    "mde_rel_pct": 2.991558372847722,
 83    "verdict": "no measurable effect",
 84    "system_worked": false
 85  },
 86  "mechanism_signature": {
 87    "math_check": {
 88      "gamma_G": 1.0,
 89      "L": 0.8,
 90      "threshold": 0.8,
 91      "rows": [
 92        {
 93          "eta": 0.5,
 94          "predicted_slope": 0.6000000000000001,
 95          "observed_slope": 0.5999100179959524,
 96          "relative_error": 0.00014997000674606592
 97        },
 98        {
 99          "eta": 1.0,
100          "predicted_slope": -0.3999999999999999,
101          "observed_slope": -0.40004000533411915,
102          "relative_error": 0.00010001333529810477
103        }
104      ],
105      "passed": true
106    },
107    "idea_grid": [
108      {
109        "cfg": {
110          "lr": 0.006,
111          "eta": 0.02
112        },
113        "result": {
114          "mean": 0.007029922096990049,
115          "std": 0.002205360988149756,
116          "per_seed": [
117            0.007741106674075127,
118            0.006892496719956398,
119            0.006658521946519613,
120            0.0070778545923531055,
121            0.0037982785142958164,
122            0.005655689164996147,
123            0.0063418434001505375,
124            0.012073585763573647
125          ],
126          "n": 8
127        }
128      },
129      {
130        "cfg": {
131          "lr": 0.006,
132          "eta": 0.08
133        },
134        "result": {
135          "mean": 0.00731758784968406,
136          "std": 0.002062769628747506,
137          "per_seed": [
138            0.00851514283567667,
139            0.006746230181306601,
140            0.0072161052376031876,
141            0.009792596101760864,
142            0.004097180441021919,
143            0.005617870483547449,
144            0.005928367376327515,
145            0.010627210140228271
146          ],
147          "n": 8
148        }
149      },
150      {
151        "cfg": {
152          "lr": 0.006,
153          "eta": 0.2
154        },
155        "result": {
156          "mean": 0.008025791961699724,
157          "std": 0.0031914273028467188,
158          "per_seed": [
159            0.009828031063079834,
160            0.006756746210157871,
161            0.0079221585765481,
162            0.015269015915691853,
163            0.004710389766842127,
164            0.005246929824352264,
165            0.005789421033114195,
166            0.00868364330381155
167          ],
168          "n": 8
169        }
170      }
171    ],
172    "trained_behavior": [
173      {
174        "seed": 0,
175        "baseline_disagreement": 0.25682780146598816,
176        "idea_disagreement": 0.24640725553035736
177      },
178      {
179        "seed": 1,
180        "baseline_disagreement": 0.23402994871139526,
181        "idea_disagreement": 0.22542807459831238
182      },
183      {
184        "seed": 2,
185        "baseline_disagreement": 0.21436160802841187,
186        "idea_disagreement": 0.2034529596567154
187      },
188      {
189        "seed": 3,
190        "baseline_disagreement": 0.24291306734085083,
191        "idea_disagreement": 0.2349667102098465
192      },
193      {
194        "seed": 4,
195        "baseline_disagreement": 0.31340721249580383,
196        "idea_disagreement": 0.3070146143436432
197      },
198      {
199        "seed": 5,
200        "baseline_disagreement": 0.24664676189422607,
201        "idea_disagreement": 0.23655381798744202
202      },
203      {
204        "seed": 6,
205        "baseline_disagreement": 0.23078785836696625,
206        "idea_disagreement": 0.21963292360305786
207      },
208      {
209        "seed": 7,
210        "baseline_disagreement": 0.24261848628520966,
211        "idea_disagreement": 0.2282203882932663
212      }
213    ],
214    "prediction": "negative disagreement trend when eta*gamma_G exceeds L",
215    "predicted_threshold": 0.8,
216    "observed_mean_baseline_disagreement": 0.2476990930736065,
217    "observed_mean_idea_disagreement": 0.23770959302783012,
218    "confirmed": true
219  },
220  "parameter_counts": {
221    "baseline": 4049,
222    "idea": 4049
223  },
224  "protocol_notes": "8 paired seeds; baseline sweep uses 4 seeds and full re-evaluation; n_train=n_test=400; same ParallelGRU base and optimizer."
225}