{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "weight_decay": 0.0001 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 25.60164165496826 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001 }, "mean": 25.508389472961426 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 13.860755920410156 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "mean": 13.839483976364136 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "mean": 8.352817177772522 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001 }, "mean": 8.268931150436401 } ], "full": { "mean": 8.206986248493195, "std": 0.7130848431694788, "per_seed": [ 7.954751968383789, 9.628533363342285, 7.705244541168213, 7.787194728851318, 7.160106182098389, 8.077467918395996, 8.747560501098633, 8.595030784606934 ], "n": 8 } }, "idea": { "mean": 15.478003978729248, "std": 1.8150899163881997, "per_seed": [ 15.246652603149414, 15.559816360473633, 14.572084426879883, 13.438393592834473, 12.848532676696777, 16.05940055847168, 17.402509689331055, 18.69664192199707 ], "n": 8, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0001, "delta0": 0.05, "damping": 0.01 }, "mean": 15.361770868301392, "per_seed": [ 16.585575103759766, 15.630778312683105, 15.600324630737305, 13.63040542602539 ] }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001, "delta0": 0.2, "damping": 0.01 }, "mean": 14.837408542633057, "per_seed": [ 16.259672164916992, 15.100025177001953, 15.465311050415039, 12.524625778198242 ] }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001, "delta0": 0.8, "damping": 0.01 }, "mean": 14.70423674583435, "per_seed": [ 15.246652603149414, 15.559816360473633, 14.572084426879883, 13.438393592834473 ] }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001, "delta0": 0.05, "damping": 0.01 }, "mean": 15.361770868301392, "per_seed": [ 16.585575103759766, 15.630778312683105, 15.600324630737305, 13.63040542602539 ] }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001, "delta0": 0.2, "damping": 0.01 }, "mean": 14.837408542633057, "per_seed": [ 16.259672164916992, 15.100025177001953, 15.465311050415039, 12.524625778198242 ] }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001, "delta0": 0.8, "damping": 0.01 }, "mean": 14.70423674583435, "per_seed": [ 15.246652603149414, 15.559816360473633, 14.572084426879883, 13.438393592834473 ] }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001, "delta0": 0.05, "damping": 0.01 }, "mean": 15.361770868301392, "per_seed": [ 16.585575103759766, 15.630778312683105, 15.600324630737305, 13.63040542602539 ] }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001, "delta0": 0.2, "damping": 0.01 }, "mean": 14.837408542633057, "per_seed": [ 16.259672164916992, 15.100025177001953, 15.465311050415039, 12.524625778198242 ] }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001, "delta0": 0.8, "damping": 0.01 }, "mean": 14.70423674583435, "per_seed": [ 15.246652603149414, 15.559816360473633, 14.572084426879883, 13.438393592834473 ] } ] }, "comparison": { "delta_mean": 7.2710177302360535, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 7.291900634765625, 5.931282997131348, 6.86683988571167, 5.651198863983154, 5.688426494598389, 7.981932640075684, 8.654949188232422, 10.101611137390137 ], "p_value": 0.0081, "mde": 1.3228311453724848, "mde_rel_pct": 16.118354598380826, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "predicted_decrease_mean": 22.893466198609936, "observed_decrease_mean": -36.19620010587904, "rho_median": 0.37037285272992004, "rho_iqr": [ -0.050449262451431096, 0.8330098316819403 ], "reject_fraction_mean": 0.2777777777777778, "confirmed": false }, "protocol_notes": "Tabular is the built-in optimizer track; both systems use identical mlp_tiny, data, epochs, and paired seeds. Baseline is Adam via train_model; idea changes only the training optimizer." }