{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "beta1": 0.85, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.0015, "beta1": 0.85, "weight_decay": 0.0 }, "mean": 12.617201328277588 }, { "cfg": { "lr": 0.0015, "beta1": 0.95, "weight_decay": 0.0 }, "mean": 15.512621641159058 }, { "cfg": { "lr": 0.003, "beta1": 0.85, "weight_decay": 0.0 }, "mean": 8.035151362419128 }, { "cfg": { "lr": 0.003, "beta1": 0.95, "weight_decay": 0.0 }, "mean": 12.083711862564087 }, { "cfg": { "lr": 0.006, "beta1": 0.85, "weight_decay": 0.0 }, "mean": 6.865306854248047 }, { "cfg": { "lr": 0.006, "beta1": 0.95, "weight_decay": 0.0 }, "mean": 8.458353757858276 } ], "full": { "mean": 7.004796802997589, "std": 0.3739293172768815, "per_seed": [ 6.71429443359375, 7.094020843505859, 6.866542816162109, 6.786369323730469, 6.342711448669434, 7.308849334716797, 7.395407676696777, 7.530178546905518 ], "n": 8 } }, "idea": { "mean": 21.87750768661499, "std": 1.4977844581209827, "per_seed": [ 22.2957763671875, 21.944984436035156, 22.89360809326172, 19.71537971496582, 19.675622940063477, 22.763729095458984, 21.369779586791992, 24.361181259155273 ], "n": 8 }, "comparison": { "delta_mean": 14.872710883617401, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 15.58148193359375, 14.850963592529297, 16.02706527709961, 12.929010391235352, 13.332911491394043, 15.454879760742188, 13.974371910095215, 16.831002712249756 ], "p_value": 0.0081, "mde": 1.1379574709779237, "mde_rel_pct": 16.24540301427378, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "mechanism_signature": { "predicted_response_mean": 0.3883231416550379, "observed_response_mean": 0.3883247250989132, "response_mae": 1.7781029070577825e-06, "update_norm_cv": 0.08146856078007694, "n_observations": 600, "prediction": "observed singular response follows t/sqrt(t^2+1), t=s/sqrt(epsilon)", "confirmed": true }, "idea_grid": [ { "cfg": { "lr": 0.0015, "beta": 0.9, "c": 0.001 }, "result": { "mean": 105.54728984832764, "std": 5.39382412585861, "per_seed": [ 114.30227661132812, 109.72885131835938, 105.97409057617188, 96.68315124511719, 103.86304473876953, 104.20171356201172, 99.61021423339844, 110.01497650146484 ], "n": 8 } }, { "cfg": { "lr": 0.003, "beta": 0.9, "c": 0.001 }, "result": { "mean": 43.18799352645874, "std": 3.9588922932446455, "per_seed": [ 49.57056427001953, 46.739295959472656, 42.695228576660156, 37.679901123046875, 39.12871551513672, 43.38615036010742, 39.62131118774414, 46.68278121948242 ], "n": 8 } }, { "cfg": { "lr": 0.006, "beta": 0.9, "c": 0.001 }, "result": { "mean": 21.87750768661499, "std": 1.4977844581209827, "per_seed": [ 22.2957763671875, 21.944984436035156, 22.89360809326172, 19.71537971496582, 19.675622940063477, 22.763729095458984, 21.369779586791992, 24.361181259155273 ], "n": 8 } } ], "track_rationale": "Optimizer modification belongs on Friedman#1 tabular MLP; architecture and data are shared." } }