{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.0015, "weight_decay": 0.0 }, "mean": 0.08054963732138276 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 0.023347282083705068 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0 }, "mean": 0.008135722251608968 } ], "full": { "mean": 0.006979767291340977, "std": 0.0037932412616514086, "per_seed": [ 0.0038006319664418697, 0.0048443530686199665, 0.007569973357021809, 0.016327930614352226, 0.004687489941716194, 0.004746445454657078, 0.008039474487304688, 0.005821839440613985 ], "n": 8 } }, "idea": { "per_seed": [ 0.003616119036450982, 0.0048443530686199665, 0.007523232605308294, 0.015394117683172226, 0.0045921714045107365, 0.004602333996444941, 0.00775922043249011, 0.005821839440613985 ], "mean": 0.006769173458451405 }, "comparison": { "delta_mean": -0.00021059383288957179, "idea_wins": 6, "n_pairs": 8, "per_seed_diffs": [ -0.00018451292999088764, 0.0, -4.674075171351433e-05, -0.0009338129311800003, -9.531853720545769e-05, -0.00014411145821213722, -0.0002802540548145771, 0.0 ], "p_value": 0.0311, "mde": 0.00025710573309478267, "mde_rel_pct": 3.683586033215538, "verdict": "idea better (significant)", "system_worked": true }, "mechanism_signature": { "window": 8, "predicted_margin_mean": 0.8796176314353943, "observed_input_sensitivity_mean": 0.0076210699044167995, "predicted_vs_observed_correlation": 0.19263989726460348, "confirmed": false }, "idea_sweep": [ { "cfg": { "lr": 0.0015, "weight_decay": 0.0 }, "mean": 0.06897093774750829 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 0.02178938896395266 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0 }, "mean": 0.007844455598387867 } ], "protocol_notes": "8 paired seeds; baseline sweep seeds 0-3 plus full best-config evaluation; idea uses same three learning rates and epochs." }