{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.005, "weight_decay": 0.0001 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 107.39756393432617 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001 }, "mean": 107.39925003051758 }, { "cfg": { "lr": 0.002, "weight_decay": 0.0 }, "mean": 44.976237297058105 }, { "cfg": { "lr": 0.002, "weight_decay": 0.0001 }, "mean": 44.978708267211914 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 24.11869478225708 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "mean": 24.120020389556885 }, { "cfg": { "lr": 0.005, "weight_decay": 0.0 }, "mean": 21.456337451934814 }, { "cfg": { "lr": 0.005, "weight_decay": 0.0001 }, "mean": 21.456222534179688 } ], "full": { "mean": 21.57731342315674, "std": 1.5687495825188427, "per_seed": [ 22.156478881835938, 22.034189224243164, 22.254423141479492, 19.379798889160156, 19.08241081237793, 22.424152374267578, 21.120243072509766, 24.166810989379883 ], "n": 8 } }, "idea": { "mean": 23.979673385620117, "std": 1.9050116210009282, "per_seed": [ 25.87602996826172, 24.822738647460938, 24.548673629760742, 21.082088470458984, 21.36577033996582, 24.733022689819336, 22.76095199584961, 26.64811134338379 ], "n": 8 }, "comparison": { "delta_mean": 2.402359962463379, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 3.7195510864257812, 2.7885494232177734, 2.29425048828125, 1.7022895812988281, 2.2833595275878906, 2.308870315551758, 1.6407089233398438, 2.4813003540039062 ], "p_value": 0.0081, "mde": 0.5469499653262384, "mde_rel_pct": 2.534838117238695, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "track_choice": "optimizer intervention matches tabular Friedman#1 track; identical mlp_tiny systems differ only in matrix momentum state", "idea_config": { "lr": 0.003, "weight_decay": 0.0001, "beta_fast": 0.9, "beta_slow": 0.99, "weight_fast": 0.5 }, "mechanism_signature": { "prediction": "impulse response initialized by a measured trained-model gradient has decay slope between fast and slow log betas", "predicted_interval": [ -0.10536051565782628, -0.01005033585350145 ], "observed_mean_slope": -0.09078844601504563, "per_seed": [ { "seed": 0, "observed_mix_log_slope": -0.09078844601504561, "predicted_fast_log_beta": -0.10536051565782628, "predicted_slow_log_beta": -0.01005033585350145 }, { "seed": 1, "observed_mix_log_slope": -0.09078844601504557, "predicted_fast_log_beta": -0.10536051565782628, "predicted_slow_log_beta": -0.01005033585350145 }, { "seed": 2, "observed_mix_log_slope": -0.09078844601504571, "predicted_fast_log_beta": -0.10536051565782628, "predicted_slow_log_beta": -0.01005033585350145 }, { "seed": 3, "observed_mix_log_slope": -0.09078844601504561, "predicted_fast_log_beta": -0.10536051565782628, "predicted_slow_log_beta": -0.01005033585350145 } ], "confirmed": true } }, "custom_track": null }