{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.0002686133266252 }, { "cfg": { "lr": 0.003 }, "mean": 2.2429956516134553e-05 }, { "cfg": { "lr": 0.006 }, "mean": 1.2719097412627889e-05 } ], "full": { "mean": 1.3684802866009704e-05, "std": 2.4297331089709535e-06, "per_seed": [ 1.0965275578200817e-05, 1.3063688129477669e-05, 1.363205592497252e-05, 1.321537001786055e-05, 1.694267484708689e-05, 1.790331407391932e-05, 1.3341849808057304e-05, 1.0414194548502564e-05 ], "n": 8 } }, "idea": { "mean": 0.0005339367999113165, "std": 0.0003344099304737304, "per_seed": [ 0.00038349704118445516, 0.0002837758220266551, 0.00047679623821750283, 0.000840833701658994, 0.00030266467365436256, 0.00031309283804148436, 0.0012979843886569142, 0.0003728496958501637 ], "n": 8, "chosen_cfg": { "lr": 0.006, "alpha": 0.75 }, "sweep": [ { "cfg": { "lr": 0.001, "alpha": 0.25 }, "mean": 0.5652050226926804, "per_seed": [ 0.5019805431365967, 0.6064469218254089, 0.5146586894989014, 0.6377339363098145 ] }, { "cfg": { "lr": 0.003, "alpha": 0.5 }, "mean": 0.05728436540812254, "per_seed": [ 0.0478343702852726, 0.05792839825153351, 0.03978803753852844, 0.08358665555715561 ] }, { "cfg": { "lr": 0.006, "alpha": 0.75 }, "mean": 0.0004962257007719018, "per_seed": [ 0.00038349704118445516, 0.0002837758220266551, 0.00047679623821750283, 0.000840833701658994 ] } ] }, "comparison": { "delta_mean": 0.0005202519970453068, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.00037253176560625434, 0.0002707121338971774, 0.0004631641822925303, 0.0008276183316411334, 0.00028572199880727567, 0.00029518952396756504, 0.001284642538848857, 0.00036243550130166113 ], "p_value": 0.0081, "mde": 0.00029926510858487807, "mde_rel_pct": 2186.8426715023597, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "prediction": "relaxation damps stochastic block-response updates approximately linearly in alpha", "predicted_alpha": 0.75, "observed_update_rms_mean": 0.0026733302263543613, "observed_update_std_mean": 0.0019501892436788798, "predicted_vs_observed_relation": "measured from trained rnn_small updates; no analytic/toy data used", "confirmed": false, "confirmation_note": "Not quantitatively confirmed: only one alpha was evaluated in the final trained-model signature, so linear alpha scaling was not tested." }, "custom_track": null }