{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 211.45939254760742 }, { "cfg": { "lr": 0.003 }, "mean": 211.45939254760742 }, { "cfg": { "lr": 0.01 }, "mean": 211.45939254760742 } ], "full": { "mean": 210.28362846374512, "std": 5.264942297259805, "per_seed": [ 216.2948760986328, 210.3721466064453, 217.16351318359375, 202.0070343017578, 208.42745971679688, 212.19456481933594, 202.8369903564453, 212.97244262695312 ], "n": 8 } }, "idea": { "mean": 210.9054012298584, "std": 5.309931146588209, "per_seed": [ 216.95388793945312, 210.90757751464844, 217.41943359375, 202.13302612304688, 210.2574005126953, 212.32080078125, 203.2976531982422, 213.95343017578125 ], "n": 8, "config": { "lr": 0.001 } }, "comparison": { "delta_mean": 0.6217727661132812, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.6590118408203125, 0.535430908203125, 0.25592041015625, 0.1259918212890625, 1.8299407958984375, 0.1262359619140625, 0.460662841796875, 0.980987548828125 ], "p_value": 0.0081, "mde": 0.47391836886435124, "mde_rel_pct": 0.2253710249944918, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "predicted_transition_ess": 4.0, "observed_ess_at_closest_hc": 4.193504810333252, "predicted_high_entropy_rate": 0.05, "observed_high_entropy_rate": 0.049303146592420355, "predicted_low_entropy_rate": 0.001, "observed_low_entropy_rate": 0.0011907811681947413, "mean_entropy": 0.571972486252586, "confirmed": true }, "idea_nearby_settings": { "0.001": [ 216.95388793945312, 210.90757751464844, 217.41943359375, 202.13302612304688, 210.2574005126953, 212.32080078125, 203.2976531982422, 213.95343017578125 ], "0.003": [ 216.95388793945312, 210.90757751464844, 217.41943359375, 202.13302612304688, 210.2574005126953, 212.32080078125, 203.2976531982422, 213.95343017578125 ], "0.01": [ 216.95388793945312, 210.90757751464844, 217.41943359375, 202.13302612304688, 210.2574005126953, 212.32080078125, 203.2976531982422, 213.95343017578125 ] }, "protocol_notes": "Optimizer ideas are matched to tabular Friedman regression; both systems use identical mlp_tiny, population, perturbation scale, steps, data, and paired seeds. Baseline fixed exponential cooling was swept over the shared lr union.", "custom_track": null }