{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "epochs": 12 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 12 }, "mean": 0.004298779065720737 }, { "cfg": { "lr": 0.003, "epochs": 12 }, "mean": 0.0034615940821822733 }, { "cfg": { "lr": 0.006, "epochs": 12 }, "mean": 0.0018282315868418664 } ], "full": { "mean": 0.002105819425196387, "std": 0.000389436566226016, "per_seed": [ 0.002004395006224513, 0.001437882543541491, 0.0015748648438602686, 0.002295783953741193, 0.0024020641576498747, 0.0024898042902350426, 0.0020851334556937218, 0.0025566271506249905 ], "n": 8 } }, "idea": { "mean": 0.0018193616560893133, "std": 0.00037736014800368497, "per_seed": [ 0.0017986779566854239, 0.0012207203544676304, 0.0014683871995657682, 0.0016677540261298418, 0.0024448649492114782, 0.002230470534414053, 0.0020495401695370674, 0.0016744780587032437 ], "n": 8 }, "comparison": { "delta_mean": -0.00028645776910707355, "idea_wins": 7, "n_pairs": 8, "per_seed_diffs": [ -0.0002057170495390892, -0.00021716218907386065, -0.00010647764429450035, -0.000628029927611351, 4.2800791561603546e-05, -0.0002593337558209896, -3.559328615665436e-05, -0.0008821490919217467 ], "p_value": 0.0224, "mde": 0.0002620079869585246, "mde_rel_pct": 12.442091844322785, "verdict": "idea better (significant)", "system_worked": true }, "mechanism_signature": { "signature": { "q": 0.03, "Gamma": 2.0, "epsilon": 0.13, "predicted_uniform_radius": 0.17285714285714285, "observed_proxy_radius_mean": 0.1817476600408554, "observed_proxy_radius_std": 0.02882220596075058, "predicted_vs_observed_correlation": NaN, "controller_refines_when_bound_exceeds_epsilon": true, "confirmed": false, "note": "trained benchmark models use adaptive resampling, but the conservative fixed-gap law is not empirically calibrated by this track" }, "idea_sweep": [ { "cfg": { "lr": 0.001, "epochs": 12 }, "result": { "mean": 0.0052960661123506725, "std": 0.0015572022789016526, "per_seed": [ 0.008267243392765522, 0.005108773708343506, 0.0028678099624812603, 0.004508262034505606, 0.005263541359454393, 0.004577877465635538, 0.0047037601470947266, 0.007071260828524828 ], "n": 8 } }, { "cfg": { "lr": 0.003, "epochs": 12 }, "result": { "mean": 0.002939960832009092, "std": 0.0017693752721639644, "per_seed": [ 0.0019986729603260756, 0.002653212519362569, 0.0012997412122786045, 0.007327801547944546, 0.0022197901271283627, 0.0036344309337437153, 0.0022852604743093252, 0.002100776880979538 ], "n": 8 } }, { "cfg": { "lr": 0.006, "epochs": 12 }, "result": { "mean": 0.0018193616560893133, "std": 0.00037736014800368497, "per_seed": [ 0.0017986779566854239, 0.0012207203544676304, 0.0014683871995657682, 0.0016677540261298418, 0.0024448649492114782, 0.002230470534414053, 0.0020495401695370674, 0.0016744780587032437 ], "n": 8 } } ] }, "idea_selected_cfg": { "lr": 0.006, "epochs": 12 }, "protocol_note": "Baseline and idea share rnn_small, data, seeds, epochs and learning-rate union; adaptive temporal resampling is the sole intervention." }