{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "eta": 0.0 }, "sweep": [ { "cfg": { "lr": 0.0015, "eta": 0.0 }, "mean": 0.13071522302925587 }, { "cfg": { "lr": 0.003, "eta": 0.0 }, "mean": 0.01457755290903151 }, { "cfg": { "lr": 0.006, "eta": 0.0 }, "mean": 0.006850881385616958 } ], "full": { "mean": 0.006962434679735452, "std": 0.0022827002771013453, "per_seed": [ 0.007542507257312536, 0.00671812891960144, 0.006612597499042749, 0.0065302918665111065, 0.003842386417090893, 0.005645386874675751, 0.006438639014959335, 0.012369539588689804 ], "n": 8 } }, "idea": { "mean": 0.007029922096990049, "std": 0.002205360988149756, "per_seed": [ 0.007741106674075127, 0.006892496719956398, 0.006658521946519613, 0.0070778545923531055, 0.0037982785142958164, 0.005655689164996147, 0.0063418434001505375, 0.012073585763573647 ], "n": 8 }, "comparison": { "delta_mean": 6.748741725459695e-05, "idea_wins": 3, "n_pairs": 8, "per_seed_diffs": [ 0.0001985994167625904, 0.00017436780035495758, 4.592444747686386e-05, 0.000547562725841999, -4.410790279507637e-05, 1.0302290320396423e-05, -9.679561480879784e-05, -0.00029595382511615753 ], "p_value": 0.51155, "mde": 0.0002082852976156794, "mde_rel_pct": 2.991558372847722, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "math_check": { "gamma_G": 1.0, "L": 0.8, "threshold": 0.8, "rows": [ { "eta": 0.5, "predicted_slope": 0.6000000000000001, "observed_slope": 0.5999100179959524, "relative_error": 0.00014997000674606592 }, { "eta": 1.0, "predicted_slope": -0.3999999999999999, "observed_slope": -0.40004000533411915, "relative_error": 0.00010001333529810477 } ], "passed": true }, "idea_grid": [ { "cfg": { "lr": 0.006, "eta": 0.02 }, "result": { "mean": 0.007029922096990049, "std": 0.002205360988149756, "per_seed": [ 0.007741106674075127, 0.006892496719956398, 0.006658521946519613, 0.0070778545923531055, 0.0037982785142958164, 0.005655689164996147, 0.0063418434001505375, 0.012073585763573647 ], "n": 8 } }, { "cfg": { "lr": 0.006, "eta": 0.08 }, "result": { "mean": 0.00731758784968406, "std": 0.002062769628747506, "per_seed": [ 0.00851514283567667, 0.006746230181306601, 0.0072161052376031876, 0.009792596101760864, 0.004097180441021919, 0.005617870483547449, 0.005928367376327515, 0.010627210140228271 ], "n": 8 } }, { "cfg": { "lr": 0.006, "eta": 0.2 }, "result": { "mean": 0.008025791961699724, "std": 0.0031914273028467188, "per_seed": [ 0.009828031063079834, 0.006756746210157871, 0.0079221585765481, 0.015269015915691853, 0.004710389766842127, 0.005246929824352264, 0.005789421033114195, 0.00868364330381155 ], "n": 8 } } ], "trained_behavior": [ { "seed": 0, "baseline_disagreement": 0.25682780146598816, "idea_disagreement": 0.24640725553035736 }, { "seed": 1, "baseline_disagreement": 0.23402994871139526, "idea_disagreement": 0.22542807459831238 }, { "seed": 2, "baseline_disagreement": 0.21436160802841187, "idea_disagreement": 0.2034529596567154 }, { "seed": 3, "baseline_disagreement": 0.24291306734085083, "idea_disagreement": 0.2349667102098465 }, { "seed": 4, "baseline_disagreement": 0.31340721249580383, "idea_disagreement": 0.3070146143436432 }, { "seed": 5, "baseline_disagreement": 0.24664676189422607, "idea_disagreement": 0.23655381798744202 }, { "seed": 6, "baseline_disagreement": 0.23078785836696625, "idea_disagreement": 0.21963292360305786 }, { "seed": 7, "baseline_disagreement": 0.24261848628520966, "idea_disagreement": 0.2282203882932663 } ], "prediction": "negative disagreement trend when eta*gamma_G exceeds L", "predicted_threshold": 0.8, "observed_mean_baseline_disagreement": 0.2476990930736065, "observed_mean_idea_disagreement": 0.23770959302783012, "confirmed": true }, "parameter_counts": { "baseline": 4049, "idea": 4049 }, "protocol_notes": "8 paired seeds; baseline sweep uses 4 seeds and full re-evaluation; n_train=n_test=400; same ParallelGRU base and optimizer." }