{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 52.02932357788086 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 14.625996589660645 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "mean": 9.001914024353027 } ], "full": { "mean": 9.259196519851685, "std": 1.0373002651087238, "per_seed": [ 8.302460670471191, 10.292799949645996, 8.400059700012207, 9.012335777282715, 7.509613037109375, 9.842769622802734, 10.44126033782959, 10.272273063659668 ], "n": 8 } }, "idea": { "mean": 15.81218934059143, "std": 1.949355068505579, "per_seed": [ 16.183080673217773, 15.5823335647583, 17.167373657226562, 13.497793197631836, 12.077912330627441, 16.422466278076172, 17.101774215698242, 18.464780807495117 ], "n": 8, "best_cfg": { "lr": 0.003, "weight_decay": 0.0 } }, "comparison": { "delta_mean": 6.552992820739746, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 7.880620002746582, 5.289533615112305, 8.767313957214355, 4.485457420349121, 4.568299293518066, 6.5796966552734375, 6.660513877868652, 8.19250774383545 ], "p_value": 0.0081, "mde": 1.3839413130321554, "mde_rel_pct": 14.94666745721392, "verdict": "idea worse (significant)", "system_worked": false }, "track_choice": "tabular is the built-in optimizer/training-dynamics match; Friedman regression keeps architecture and task fixed.", "idea_sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "result": { "mean": 76.82785987854004, "std": 25.70975037882407, "per_seed": [ 70.13491821289062, 102.93740844726562, 84.74547576904297, 91.09562683105469, 33.59514236450195, 98.26583099365234, 37.17234420776367, 96.67613220214844 ], "n": 8 } }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "result": { "mean": 15.81218934059143, "std": 1.949355068505579, "per_seed": [ 16.183080673217773, 15.5823335647583, 17.167373657226562, 13.497793197631836, 12.077912330627441, 16.422466278076172, 17.101774215698242, 18.464780807495117 ], "n": 8, "best_cfg": { "lr": 0.003, "weight_decay": 0.0 } } }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "result": { "mean": 34.88474154472351, "std": 15.230981751784949, "per_seed": [ 34.66309356689453, 59.120567321777344, 43.088172912597656, 53.1762580871582, 21.203292846679688, 34.56721496582031, 14.101446151733398, 19.157886505126953 ], "n": 8 } } ], "budget": { "baseline_epochs": 16, "idea_generations": 16, "population": 8 }, "mechanism_signature": { "observed_cov_increment": 0.000783836052484821, "predicted_2D_increment": 0.0005999999999999998, "relative_error": 0.3063934202973796, "curvature_median_final": -8.0, "confirmed": true, "trained_model_metric": 16.183080673217773 } }