{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 0.0720269184675999 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 0.0028564660606207326 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0 }, "mean": 0.00228094776684884 } ], "full": { "mean": 0.00228094776684884, "std": 0.0008615682293713639, "per_seed": [ 0.002221147296950221, 0.001970731420442462, 0.0013024760410189629, 0.0042177895084023476, 0.0020735678263008595, 0.0015317687066271901, 0.002943465718999505, 0.0019866356160491705 ], "n": 8 } }, "idea": { "cfg": { "lr": 0.006, "weight_decay": 0.0, "kappa": 8.0 }, "mean": 0.002070821574307047, "std": 0.0007668985617216761, "per_seed": [ 0.0024689047131687403, 0.0014718936290591955, 0.0017854231409728527, 0.0037137719336897135, 0.0013458451721817255, 0.0012669704155996442, 0.0025451004039496183, 0.0019686631858348846 ], "n": 8 }, "comparison": { "delta_mean": -0.000210126192541793, "delta_std": 0.0003877800102460661, "p_value": 0.1702, "diffs": [ 0.0002477574162185192, -0.0004988377913832664, 0.00048294709995388985, -0.0005040175747126341, -0.000727722654119134, -0.00026479829102754593, -0.0003983653150498867, -1.797243021428585e-05 ] }, "mechanism_signature": { "math_check": { "kappas": [ 1, 2, 4, 8, 16 ], "delays": [ 0.9989999999999988, 0.4989999999999988, 0.24899999999999878, 0.12399999999999878, 0.062000000000001165 ], "predicted_offset_slope": 1.0, "fit_slope": 0.9997204301075259, "r2": 0.9999997339246215, "passed": true }, "idea_sweep": [ { "cfg": { "lr": 0.006, "weight_decay": 0.0, "kappa": 2.0 }, "mean": 0.002092966591590084, "std": 0.0007941076298383792, "per_seed": [ 0.0025941352359950542, 0.0013959517236799002, 0.0019340378930792212, 0.0037612225860357285, 0.0012745162239298224, 0.0012861500727012753, 0.0025039087049663067, 0.0019938102923333645 ], "n": 8 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0, "kappa": 4.0 }, "mean": 0.0020771025301655754, "std": 0.0007748204332654841, "per_seed": [ 0.002521086484193802, 0.0014459786470979452, 0.0018341594841331244, 0.003721740795299411, 0.0013138779904693365, 0.001272903406061232, 0.0025291924830526114, 0.0019778809510171413 ], "n": 8 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0, "kappa": 8.0 }, "mean": 0.002070821574307047, "std": 0.0007668985617216761, "per_seed": [ 0.0024689047131687403, 0.0014718936290591955, 0.0017854231409728527, 0.0037137719336897135, 0.0013458451721817255, 0.0012669704155996442, 0.0025451004039496183, 0.0019686631858348846 ], "n": 8 } ], "comparison_recomputed": { "delta_mean": -0.000210126192541793, "delta_std": 0.0003877800102460661, "p_value": 0.1702, "diffs": [ 0.0002477574162185192, -0.0004988377913832664, 0.00048294709995388985, -0.0005040175747126341, -0.000727722654119134, -0.00026479829102754593, -0.0003983653150498867, -1.797243021428585e-05 ] }, "mechanism_signature": { "prediction": "lag delay scales as 1/kappa and positive feed-forward compensation reduces it", "trained_model_measurements": [ { "kappa": 2.0, "baseline_cross_step": 1.0, "idea_cross_step": 1.0, "observed_mean_effective_gap": 0.0 }, { "kappa": 4.0, "baseline_cross_step": 1.0, "idea_cross_step": 1.0, "observed_mean_effective_gap": 0.0 }, { "kappa": 8.0, "baseline_cross_step": 1.0, "idea_cross_step": 1.0, "observed_mean_effective_gap": 0.0 } ], "confirmed": false, "reason": "No reliable local-growth threshold crossing was observed consistently in the trained dynamics runs; therefore the NN-scale quantitative claim is not confirmed." } } }