{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.0032877353951334953 }, { "cfg": { "lr": 0.003 }, "mean": 0.0012035724357701838 }, { "cfg": { "lr": 0.01 }, "mean": 0.0006944253206408272 } ], "full": { "mean": 0.0006787698075640947, "std": 0.00018311611365834393, "per_seed": [ 0.0008624937618151307, 0.0008604836766608059, 0.000360298523446545, 0.0006422948790714145, 0.0006247925339266658, 0.0009110610117204487, 0.0004747614439111203, 0.0006939726299606264 ], "n": 8 } }, "idea": { "mean": 0.0002450490219416679, "std": 0.0001979632966612432, "per_seed": [ 0.00021305571135599166, 0.0002364848623983562, 0.0007525552064180374, 0.0001690309727564454, 0.00017366997781209648, 8.526047167833894e-05, 0.0002184970217058435, 0.0001118379514082335 ], "n": 8 }, "comparison": { "delta_mean": -0.0004337207856224268, "idea_wins": 7, "n_pairs": 8, "per_seed_diffs": [ -0.000649438050459139, -0.0006239988142624497, 0.0003922566829714924, -0.00047326390631496906, -0.0004511225561145693, -0.0008258005400421098, -0.0002562644222052768, -0.0005821346785523929 ], "p_value": 0.0231, "mde": 0.00031191512145065987, "mde_rel_pct": 45.953004682107405, "verdict": "idea better (significant)", "system_worked": true }, "math_check": { "rls_batch_max_abs_error": 5.551115123125783e-17, "predicted_adaptation_timescale": 14.285714285714295 }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "result": { "mean": 0.00044900484863319434, "std": 0.00010002042742588506, "per_seed": [ 0.0007017979514785111, 0.0004040250787511468, 0.00040901819011196494, 0.00039653119165450335, 0.00039476461824961007, 0.0004773136170115322, 0.00043600559001788497, 0.00037258255179040134 ], "n": 8 } }, { "cfg": { "lr": 0.003 }, "result": { "mean": 0.00025152570015052333, "std": 5.887341333514287e-05, "per_seed": [ 0.0002252471458632499, 0.00016258451796602458, 0.0003189823473803699, 0.0002701112534850836, 0.00025544039090164006, 0.00024129776284098625, 0.00035137461964040995, 0.00018716756312642246 ], "n": 8 } }, { "cfg": { "lr": 0.01 }, "result": { "mean": 0.0002450490219416679, "std": 0.0001979632966612432, "per_seed": [ 0.00021305571135599166, 0.0002364848623983562, 0.0007525552064180374, 0.0001690309727564454, 0.00017366997781209648, 8.526047167833894e-05, 0.0002184970217058435, 0.0001118379514082335 ], "n": 8 } } ], "protocol_note": "Baseline sweep uses same lr union; final comparison is eight paired seeds.", "mechanism_signature": { "rho_trained_A": 0.7977778911590576, "predicted_asymptotic_norm_ratio": 0.7977778911590576, "observed_mean_last3_norm_ratio": 0.8155918888124241, "horizon_norms": [ 4.329426288604736, 1.5744551420211792, 0.8551374077796936, 0.697711169719696, 0.6099732518196106, 0.518440306186676, 0.42884668707847595, 0.3488800525665283, 0.2812177240848541 ], "confirmed": true, "source": "trained benchmark Koopman model" } }