{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 6.268094512051903e-05 }, { "cfg": { "lr": 0.003 }, "mean": 2.4053396373346914e-05 }, { "cfg": { "lr": 0.006 }, "mean": 1.9922963019780582e-05 } ], "full": { "mean": 1.6942617776294355e-05, "std": 7.0294610370873945e-06, "per_seed": [ 2.646726898092311e-05, 1.3497274267137982e-05, 1.7921185644809157e-05, 2.180612318625208e-05, 1.1675516361719929e-05, 9.150396181212272e-06, 2.697196396184154e-05, 8.051213626458775e-06 ], "n": 8 } }, "idea": { "mean": 6.218317793127426e-06, "std": 2.61984541800953e-06, "per_seed": [ 2.8394540549925296e-06, 8.368528142455034e-06, 4.065665507368976e-06, 6.483904144261032e-06, 2.6967427402269095e-06, 9.669754945207387e-06, 9.356464033771772e-06, 6.266028776735766e-06 ], "n": 8, "chosen_cfg": { "lr": 0.006, "tmax": 8 }, "sweep": [ { "cfg": { "lr": 0.001, "tmax": 8 }, "mean": 3.799157411776832e-05, "per_seed": [ 2.9381331842159852e-05, 6.0935002693440765e-05, 3.8257920095929876e-05, 2.33920418395428e-05 ] }, { "cfg": { "lr": 0.003, "tmax": 8 }, "mean": 1.020754018554726e-05, "per_seed": [ 6.3169459281198215e-06, 1.2884396710433066e-05, 1.2727699868264608e-05, 8.901118235371541e-06 ] }, { "cfg": { "lr": 0.006, "tmax": 8 }, "mean": 5.439387962269393e-06, "per_seed": [ 2.8394540549925296e-06, 8.368528142455034e-06, 4.065665507368976e-06, 6.483904144261032e-06 ] } ] }, "comparison": { "delta_mean": -1.072429998316693e-05, "idea_wins": 7, "n_pairs": 8, "per_seed_diffs": [ -2.362781492593058e-05, -5.128746124682948e-06, -1.385552013744018e-05, -1.5322219041991048e-05, -8.97877362149302e-06, 5.193587639951147e-07, -1.7615499928069767e-05, -1.7851848497230094e-06 ], "p_value": 0.0163, "mde": 6.964423506000914e-06, "mde_rel_pct": 41.105947132593315, "verdict": "idea better (significant)", "system_worked": true }, "mechanism_signature": { "prediction": "shared adaptive recurrence performs fewer than Tmax weighted updates on trained inputs", "predicted": { "weighted_steps": "< 8" }, "observed": { "mean_weighted_steps": 1.24119733273983, "mean_mass": 1.0, "per_seed_steps": [ 1.2474790811538696, 1.2404111623764038, 1.2472835779190063, 1.2294979095458984, 1.252071499824524, 1.2432061433792114, 1.2319114208221436, 1.237717866897583 ] }, "confirmed": true, "parameter_counts": { "baseline": 135297, "idea": 18434 } }, "corrected_protocol": true }