{ "bench_version": 1, "track": "dynamics", "model": "rnn_small_fractional", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.0004224302538204938 }, { "cfg": { "lr": 0.003 }, "mean": 3.919086066161981e-05 }, { "cfg": { "lr": 0.01 }, "mean": 1.4552034826920135e-05 } ], "full": { "mean": 1.477801822602487e-05, "std": 5.904456722576056e-06, "per_seed": [ 2.641624269017484e-05, 8.83757365954807e-06, 8.367352165805642e-06, 1.4586970792151988e-05, 1.0999674486811273e-05, 2.1751329768449068e-05, 1.276554939977359e-05, 1.4499452845484484e-05 ], "n": 8 } }, "idea": { "mean": 0.00025887351512210444, "std": 5.818967880653584e-05, "per_seed": [ 0.0002734987938310951, 0.00015879524289630353, 0.00034040064201690257, 0.00028941663913428783, 0.000296872021863237, 0.00026502739638090134, 0.0002749341365415603, 0.0001720432483125478 ], "n": 8 }, "comparison": { "delta_mean": 0.00024409549689607957, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.00024708255114092026, 0.00014995766923675546, 0.0003320332898510969, 0.00027482966834213585, 0.00028587234737642575, 0.00024327606661245227, 0.0002621685871417867, 0.00015754379546706332 ], "p_value": 0.0081, "mde": 5.2037973707415915e-05, "mde_rel_pct": 352.13093468631877, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "math_sanity": [ { "dt": 0.1, "predicted_rho": 0.9992190550963239, "observed_rho": 0.9992190550963239, "stable": true }, { "dt": 1.0, "predicted_rho": 0.9922179382602435, "observed_rho": 0.9922179382602435, "stable": true }, { "dt": 4.0, "predicted_rho": 0.9692332344763441, "observed_rho": 0.9692332344763441, "stable": true }, { "predicted_log_slope": -0.5, "observed_log_slope": -0.8731882906575884, "abs_error": 0.3731882906575884, "positive_weights": true } ], "trained_model_behavior": { "prediction": "trained exponential-bank memory impulse log-slope p-1", "p": 0.5, "predicted": -0.5, "observed": -0.8731883349875018, "abs_error": 0.3731883349875018, "trained_positive_weights": true, "measurement": "trained model lam/w state response", "confirmed": false }, "track_choice": "dynamics: actuated pendulum stability/control is structurally matched", "idea_sweep": [ { "cfg": { "lr": 0.001, "p": 0.5 }, "mean": 0.00031832019703870174 }, { "cfg": { "lr": 0.003, "p": 0.5 }, "mean": 0.00025887351512210444 }, { "cfg": { "lr": 0.01, "p": 0.5 }, "mean": 0.0007522592495661229 } ] }, "stage2_protocol": { "epochs": 12, "batch": 128, "baseline_grid": [ { "lr": 0.001 }, { "lr": 0.003 }, { "lr": 0.01 } ], "idea_grid": [ { "lr": 0.001, "p": 0.5 }, { "lr": 0.003, "p": 0.5 }, { "lr": 0.01, "p": 0.5 } ], "paired_seeds": [ 0, 1, 2, 3, 4, 5, 6, 7 ] } }