{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 15.53538990020752 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 9.415347337722778 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0 }, "mean": 7.360140562057495 } ], "full": { "mean": 7.4583141803741455, "std": 0.6102747432817298, "per_seed": [ 7.289438247680664, 8.00219440460205, 7.081491947174072, 7.067437648773193, 6.286782264709473, 7.646380424499512, 8.093415260314941, 8.199373245239258 ], "n": 8 } }, "idea": { "mean": 7.388119101524353, "std": 0.6041003222700619, "per_seed": [ 6.846275329589844, 7.8614349365234375, 7.108870506286621, 7.15531587600708, 6.309638023376465, 7.587562084197998, 8.090027809143066, 8.145828247070312 ], "n": 8 }, "comparison": { "delta_mean": -0.07019507884979248, "idea_wins": 5, "n_pairs": 8, "per_seed_diffs": [ -0.4431629180908203, -0.14075946807861328, 0.027378559112548828, 0.08787822723388672, 0.022855758666992188, -0.05881834030151367, -0.003387451171875, -0.05354499816894531 ], "p_value": 0.2587, "mde": 0.13852366888165354, "mde_rel_pct": 1.8573053579073617, "verdict": "no measurable effect", "system_worked": false }, "idea_trials": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "result": { "mean": 16.191248655319214, "std": 1.334610265709453, "per_seed": [ 15.566378593444824, 16.270675659179688, 17.070934295654297, 14.182695388793945, 14.616189002990723, 15.975017547607422, 17.418180465698242, 18.42991828918457 ], "n": 8 } }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "result": { "mean": 9.826780676841736, "std": 1.0954169590780658, "per_seed": [ 8.976614952087402, 11.023777961730957, 9.17143726348877, 9.166444778442383, 8.010053634643555, 10.084756851196289, 10.998445510864258, 11.182714462280273 ], "n": 8 } }, { "cfg": { "lr": 0.006, "weight_decay": 0.0 }, "result": { "mean": 7.388119101524353, "std": 0.6041003222700619, "per_seed": [ 6.846275329589844, 7.8614349365234375, 7.108870506286621, 7.15531587600708, 6.309638023376465, 7.587562084197998, 8.090027809143066, 8.145828247070312 ], "n": 8 } } ], "task_match": "optimizer intervention on Friedman regression", "mechanism_signature": { "raw_grad_lag1_corr": 0.3716290132687427, "corrected_grad_lag1_corr": 0.12645231312280522, "baseline_raw_grad_lag1_corr": 0.5400456543155014, "confirmed": true } }