{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.004247799690347165 }, { "cfg": { "lr": 0.003 }, "mean": 0.0018907261837739497 }, { "cfg": { "lr": 0.01 }, "mean": 0.0005508567701326683 } ], "full": { "mean": 0.00043304020073264837, "std": 0.00018680572581609252, "per_seed": [ 0.000348469679011032, 0.00044166683801449835, 0.0005423855036497116, 0.0008709050598554313, 0.00039059933624230325, 0.0003389842459000647, 0.0002937567769549787, 0.00023755416623316705 ], "n": 8 } }, "idea": { "mean": 1.8605211664635135e-05, "std": 2.831933136541298e-05, "per_seed": [ 1.025223082251614e-05, 5.093114396004239e-06, 3.275605195085518e-06, 2.0394263628986664e-05, 5.965866421320243e-06, 7.376182111329399e-06, 9.230343130184337e-05, 4.180999439995503e-06 ], "n": 8 }, "comparison": { "delta_mean": -0.00041443498906801324, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -0.00033821744818851585, -0.0004365737236184941, -0.0005391098984546261, -0.0008505107962264447, -0.000384633469820983, -0.0003316080637887353, -0.00020145334565313533, -0.00023337316679317155 ], "p_value": 0.0081, "mde": 0.0001724928317781249, "mde_rel_pct": 39.832983516608664, "verdict": "idea better (significant)", "system_worked": true }, "mechanism_signature": { "predicted_slowest_memory_mode": 0.3352634608745575, "observed_max_state_norm": 2.583609104156494, "bounded_observed_state": true, "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "mean": 5.264711217023432e-05 }, { "cfg": { "lr": 0.003 }, "mean": 1.748438717186218e-05 }, { "cfg": { "lr": 0.01 }, "mean": 9.75380351064814e-06 } ], "idea_best_cfg": { "lr": 0.01 }, "track_justification": "Dynamics is structurally matched: the task is actuated pendulum forecasting and the intervention is a stable recurrent memory state.", "search_space_parity": { "baseline_grid": [ 0.001, 0.003, 0.01 ], "idea_grid": [ 0.001, 0.003, 0.01 ], "selected_idea_lr": 0.01 }, "parameterization": { "baseline_params": 3585, "idea_params": 16077, "epochs": 12, "n_train": 1000, "n_test": 300 } }