{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.005, "rho_cap": null }, "sweep": [ { "cfg": { "lr": 0.001, "rho_cap": null }, "mean": 0.0012295851483941078 }, { "cfg": { "lr": 0.003, "rho_cap": null }, "mean": 0.0006583010253962129 }, { "cfg": { "lr": 0.005, "rho_cap": null }, "mean": 0.0004532121238298714 } ], "full": { "mean": 0.00038185320590855554, "std": 0.00016136478368296086, "per_seed": [ 0.00046871721860952675, 0.0002616161364130676, 0.00031301137642003596, 0.0007695037638768554, 0.0003513892588671297, 0.0002713301219046116, 0.0002475073270034045, 0.00037175044417381287 ], "n": 8 } }, "idea": { "mean": 0.00016176951703528175, "std": 2.54928932189329e-05, "per_seed": [ 0.00013927802501711994, 0.0001758444996085018, 0.0001558296353323385, 0.00020030193263664842, 0.0001420884218532592, 0.00012167391105322167, 0.00016640945977997035, 0.00019273025100119412 ], "n": 8 }, "comparison": { "delta_mean": -0.00022008368887327379, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -0.0003294391935924068, -8.577163680456579e-05, -0.00015718174108769745, -0.000569201831240207, -0.00020930083701387048, -0.00014965621085138991, -8.109786722343415e-05, -0.00017902019317261875 ], "p_value": 0.0081, "mde": 0.0001347953881261106, "mde_rel_pct": 35.3003159435018, "verdict": "idea better (significant)", "system_worked": true }, "mechanism_signature": { "signature": { "prediction": "projected recurrent operator-gain proxy stays <= 0.90", "predicted_max": 0.7689717411994934, "observed": [ { "seed": 0, "predicted_gain_proxy": 0.7254310846328735, "observed_output_gain": 0.0707114040851593 }, { "seed": 1, "predicted_gain_proxy": 0.7678388953208923, "observed_output_gain": 0.09257301688194275 }, { "seed": 2, "predicted_gain_proxy": 0.7689717411994934, "observed_output_gain": 0.07351840287446976 }, { "seed": 3, "predicted_gain_proxy": 0.7672179341316223, "observed_output_gain": 0.07399722933769226 } ], "confirmed": true }, "idea_sweep": { "0.001": { "mean": 0.00032572537929809187, "std": 6.515504960120716e-05, "per_seed": [ 0.00024285227118525654, 0.00030959199648350477, 0.0003330624313093722, 0.00036215895670466125, 0.00030998658621683717, 0.0002514962980058044, 0.0003306802245788276, 0.00046597426990047097 ], "n": 8 }, "0.003": { "mean": 0.0002240399771835655, "std": 3.985152266293653e-05, "per_seed": [ 0.00017446346464566886, 0.00022571365116164088, 0.00022476879530586302, 0.0002838608343154192, 0.00020102885900996625, 0.00017465419659856707, 0.00022299615375231951, 0.0002848338626790792 ], "n": 8 }, "0.005": { "mean": 0.00016176951703528175, "std": 2.54928932189329e-05, "per_seed": [ 0.00013927802501711994, 0.0001758444996085018, 0.0001558296353323385, 0.00020030193263664842, 0.0001420884218532592, 0.00012167391105322167, 0.00016640945977997035, 0.00019273025100119412 ], "n": 8 } }, "selected_idea_lr": 0.005, "structure": "GRU recurrent dynamics; spectral-gain projection is the only intervention" }, "baseline_sweep_union_note": "Baseline evaluated all idea learning rates; baseline method has no additional decisive knob." }