{ "bench_version": 1, "track": "poisson_measurements", "model": "custom_measurement_mlp", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.00023615473219251726 }, { "cfg": { "lr": 0.003 }, "mean": 8.562382845411776e-05 }, { "cfg": { "lr": 0.01 }, "mean": 7.791408143020817e-05 } ], "full": { "mean": 7.791408143020817e-05, "std": 1.909924833468627e-05, "per_seed": [ 0.00011997614637948573, 5.3765939810546115e-05, 8.39241110952571e-05, 6.556373409694061e-05, 8.531597995897755e-05, 8.173154492396861e-05, 7.142309914343059e-05, 6.161209603305906e-05 ], "n": 8 } }, "idea": { "mean": 0.0148575731087476, "std": 0.0016423097465859962, "per_seed": [ 0.017279266317685445, 0.014548975912233194, 0.015849430797000727, 0.017124839189151923, 0.013294871213535469, 0.014724781985084217, 0.012648728614052137, 0.013389690841237704 ], "n": 8 }, "comparison": { "delta_mean": 0.014779659027317392, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.01715929017130596, 0.014495209972422648, 0.01576550668590547, 0.017059275455054982, 0.013209555233576491, 0.014643050440160248, 0.012577305514908706, 0.013328078745204645 ], "p_value": 0.0081, "mde": 0.0014603972953644863, "mde_rel_pct": 1874.3688798701203, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "prediction": "permutation invariance of sensor aggregation", "predicted_max_abs": 0.0, "observed_max_abs": 2.2351741790771484e-08, "confirmed": true }, "custom_track": { "name": "poisson_measurements", "file": "custom_track.py", "domain": "pde" }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.01485852306553473 }, { "cfg": { "lr": 0.003 }, "mean": 0.0148575731087476 }, { "cfg": { "lr": 0.01 }, "mean": 0.014859355776570736 } ] }