{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.0016004437929950655 }, { "cfg": { "lr": 0.003 }, "mean": 0.0008657508878968656 }, { "cfg": { "lr": 0.01 }, "mean": 0.0003360401788086165 } ], "full": { "mean": 0.00029742292554146843, "std": 0.00012590863545935686, "per_seed": [ 0.0004953785100951791, 0.0003386490570846945, 0.0002134958194801584, 0.0002966373285744339, 0.0001490332215325907, 0.00031617036438547075, 0.0001173576238215901, 0.00045266147935763 ], "n": 8 } }, "idea": { "mean": 0.00031140187456912827, "std": 0.00012528404252057512, "per_seed": [ 0.0005046091391704977, 0.00035253993701189756, 0.00023353651340585202, 0.00032840640051290393, 0.00015706471458543092, 0.00032477168133482337, 0.00012830838386435062, 0.00046197822666727006 ], "n": 8 }, "comparison": { "delta_mean": 1.3978949027659837e-05, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 9.230629075318575e-06, 1.389087992720306e-05, 2.004069392569363e-05, 3.1769071938470006e-05, 8.031493052840233e-06, 8.601316949352622e-06, 1.0950760042760521e-05, 9.31674730964005e-06 ], "p_value": 0.0081, "mde": 6.858680107943e-06, "mde_rel_pct": 2.3060361253109667, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "best_idea_cfg": { "lr": 0.01, "lambda": 0.02 }, "all_idea_settings": { "0.001": { "mean": 0.0016261089622275904, "std": 0.00047570904542975056, "per_seed": [ 0.0012551955878734589, 0.0012359732063487172, 0.0015323605621233582, 0.002465372672304511, 0.001136873965151608, 0.0012831705389544368, 0.001836425275541842, 0.002263499889522791 ], "n": 8 }, "0.003": { "mean": 0.0008687566078151576, "std": 0.0002024636252280242, "per_seed": [ 0.0008179493015632033, 0.0007614863570779562, 0.0006751477485522628, 0.001272146706469357, 0.0006523997872136533, 0.0007431273115798831, 0.0009471484227105975, 0.0010806472273543477 ], "n": 8 }, "0.01": { "mean": 0.00031140187456912827, "std": 0.00012528404252057512, "per_seed": [ 0.0005046091391704977, 0.00035253993701189756, 0.00023353651340585202, 0.00032840640051290393, 0.00015706471458543092, 0.00032477168133482337, 0.00012830838386435062, 0.00046197822666727006 ], "n": 8 } }, "custom_track": null, "signature": { "prediction": "horizon weighting produces a finite, measured sensitivity proxy", "observed": [ { "seed": 0, "observed_jacobian_abs": 0.047531094402074814, "tube_weighted_observed": 0.039783747423522677 }, { "seed": 1, "observed_jacobian_abs": 0.046463221311569214, "tube_weighted_observed": 0.03905660488809137 }, { "seed": 2, "observed_jacobian_abs": 0.04596756026148796, "tube_weighted_observed": 0.04002308358438155 }, { "seed": 3, "observed_jacobian_abs": 0.0467328242957592, "tube_weighted_observed": 0.040204589420798326 } ], "predicted_vs_observed_ratio": 0.852146210300268, "confirmed": false } }, "protocol_notes": { "paired_seeds": [ 0, 1, 2, 3, 4, 5, 6, 7 ], "epochs": 12, "n_train": 800, "n_test": 200, "structural_match": "dynamics/control", "baseline_grid_equals_idea_union": true } }