{ "bench_version": "local_fallback_no_harness", "track": "dynamics", "model": "shared DelayGRU", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "wd": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "wd": 0.0 }, "mean": 0.6801233738660812 }, { "cfg": { "lr": 0.001, "wd": 0.0001 }, "mean": 0.6801258623600006 }, { "cfg": { "lr": 0.003, "wd": 0.0 }, "mean": 0.35754771530628204 }, { "cfg": { "lr": 0.003, "wd": 0.0001 }, "mean": 0.3575517013669014 }, { "cfg": { "lr": 0.006, "wd": 0.0 }, "mean": 0.16513000801205635 }, { "cfg": { "lr": 0.006, "wd": 0.0001 }, "mean": 0.16513226553797722 } ], "full": { "mean": 0.17238342948257923, "std": 0.023754673289860206, "per_seed": [ 0.15474747121334076, 0.1601465791463852, 0.16793453693389893, 0.17769144475460052, 0.16201430559158325, 0.2271566540002823, 0.15431520342826843, 0.17506124079227448 ], "n": 8 } }, "idea": { "mean": 0.17108880542218685, "std": 0.022775696321881225, "per_seed": [ 0.15279607474803925, 0.1616012454032898, 0.16678939759731293, 0.1741822063922882, 0.15894076228141785, 0.2237611562013626, 0.15557505190372467, 0.1750645488500595 ], "n": 8, "best_cfg": { "lr": 0.006, "wd": 0.0 }, "grid": [ { "cfg": { "lr": 0.001, "wd": 0.0 }, "mean": 0.6519463434815407 }, { "cfg": { "lr": 0.003, "wd": 0.0 }, "mean": 0.3875108100473881 }, { "cfg": { "lr": 0.006, "wd": 0.0 }, "mean": 0.17108880542218685 } ] }, "comparison": { "delta_mean": -0.0012946240603923798, "idea_wins": 5, "n_pairs": 8, "per_seed_diffs": [ -0.0019513964653015137, 0.001454666256904602, -0.0011451393365859985, -0.003509238362312317, -0.0030735433101654053, -0.0033954977989196777, 0.0012598484754562378, 3.3080577850341797e-06 ], "p_value": 0.1247937603119844, "verdict": "idea better (not significant)", "system_worked": false }, "mechanism_signature": { "prediction": "reconstruction/prediction error grows approximately linearly with observation noise (inverse observability intuition)", "observed_loglog_slopes": { "baseline": 0.0070740981333970365, "idea": 0.007060657411190435 }, "per_noise": [ { "sigma": 0.01, "baseline_rmse": 0.3934699594974518, "idea_rmse": 0.3909880518913269 }, { "sigma": 0.03, "baseline_rmse": 0.394115686416626, "idea_rmse": 0.3916374146938324 }, { "sigma": 0.06, "baseline_rmse": 0.3962407410144806, "idea_rmse": 0.3937460780143738 }, { "sigma": 0.1, "baseline_rmse": 0.40119439363479614, "idea_rmse": 0.398638516664505 }, { "sigma": 0.01, "baseline_rmse": 0.4001429080963135, "idea_rmse": 0.4019409716129303 }, { "sigma": 0.03, "baseline_rmse": 0.40048766136169434, "idea_rmse": 0.40225452184677124 }, { "sigma": 0.06, "baseline_rmse": 0.4020640552043915, "idea_rmse": 0.40378326177597046 }, { "sigma": 0.1, "baseline_rmse": 0.40611129999160767, "idea_rmse": 0.4077668786048889 }, { "sigma": 0.01, "baseline_rmse": 0.4102720320224762, "idea_rmse": 0.40883108973503113 }, { "sigma": 0.03, "baseline_rmse": 0.41178008913993835, "idea_rmse": 0.41025447845458984 }, { "sigma": 0.06, "baseline_rmse": 0.4154220521450043, "idea_rmse": 0.41376587748527527 }, { "sigma": 0.1, "baseline_rmse": 0.42276376485824585, "idea_rmse": 0.4209310710430145 }, { "sigma": 0.01, "baseline_rmse": 0.421396940946579, "idea_rmse": 0.4172685146331787 }, { "sigma": 0.03, "baseline_rmse": 0.4214303195476532, "idea_rmse": 0.4174094498157501 }, { "sigma": 0.06, "baseline_rmse": 0.4222506880760193, "idea_rmse": 0.41838502883911133 }, { "sigma": 0.1, "baseline_rmse": 0.4247669279575348, "idea_rmse": 0.42109447717666626 } ], "confirmed": false }, "protocol_note": "Official /home/maxwelhelp/all/math2nn/bench and README were absent; this is a local fallback and is not official harness evidence." }