{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.008 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 61.77081108093262 }, { "cfg": { "lr": 0.002 }, "mean": 17.307271003723145 }, { "cfg": { "lr": 0.003 }, "mean": 15.343324422836304 }, { "cfg": { "lr": 0.005 }, "mean": 12.93674373626709 }, { "cfg": { "lr": 0.008 }, "mean": 10.50437068939209 } ], "full": { "mean": 10.8468017578125, "std": 0.9460715154353679, "per_seed": [ 10.433314323425293, 9.383343696594238, 12.219518661499023, 9.981306076049805, 10.63367748260498, 10.9376859664917, 10.86903190612793, 12.316535949707031 ], "n": 8 } }, "idea": { "mean": 8.208642661571503, "std": 0.5742573828718772, "per_seed": [ 7.412168025970459, 7.734030246734619, 8.057981491088867, 7.578333377838135, 8.25620174407959, 8.907169342041016, 8.773388862609863, 8.949868202209473 ], "n": 8 }, "comparison": { "delta_mean": -2.6381590962409973, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -3.021146297454834, -1.6493134498596191, -4.161537170410156, -2.40297269821167, -2.3774757385253906, -2.0305166244506836, -2.0956430435180664, -3.3666677474975586 ], "p_value": 0.0081, "mde": 0.6897071822966465, "mde_rel_pct": 6.3586225478849485, "verdict": "idea better (significant)", "system_worked": true }, "track_choice": "tabular: the idea is an optimizer/black-box hyperparameter infill method; no architecture or sequence/control structure is required.", "shared_lr_union": [ 0.001, 0.002, 0.003, 0.005, 0.008 ], "epochs": 12, "n_train": 800, "mechanism_signature": { "pilot_validation_mean": 7.560150101780891, "gn_predicted_validation_mean": 8.995661415256667, "gn_observed_validation_mean": 8.700061082839966, "absolute_prediction_error": 0.5079499775828902, "condition_estimate": 1.0, "confirmed": true }, "math_check": { "exact_linear_jacobian_relative_error": 0.8606629657653821 } }