{ "bench_version": 1, "track": "tabular", "model": "mlp_bottleneck", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.008, "eta": 0.0 }, "sweep": [ { "cfg": { "lr": 0.002, "eta": 0.0 }, "mean": 12.123852729797363 }, { "cfg": { "lr": 0.004, "eta": 0.0 }, "mean": 8.107524752616882 }, { "cfg": { "lr": 0.008, "eta": 0.0 }, "mean": 7.050076246261597 } ], "full": { "mean": 7.273632645606995, "std": 0.5744234790485494, "per_seed": [ 6.92377233505249, 7.258182048797607, 6.877320289611816, 7.141030311584473, 6.306039810180664, 7.486922264099121, 8.12838363647461, 8.067410469055176 ], "n": 8 } }, "idea": { "mean": 7.273632645606995, "std": 0.5744234790485494, "per_seed": [ 6.92377233505249, 7.258182048797607, 6.877320289611816, 7.141030311584473, 6.306039810180664, 7.486922264099121, 8.12838363647461, 8.067410469055176 ], "n": 8 }, "comparison": { "delta_mean": 0.0, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0 ], "p_value": 1.0, "mde": 0.0, "mde_rel_pct": 0.0, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction": "larger eta produces larger trained GMM signature separation", "eta_rows": [ { "cfg": { "lr": 0.008, "eta": 0.02 }, "observed_min_dist_mean": 2.4002824127674103, "observed_min_dist_per_seed": [ 2.228745698928833, 2.3035049438476562, 2.495332717895508, 2.4624271392822266, 2.388399839401245, 2.2766027450561523, 2.3105733394622803, 2.736672878265381 ] }, { "cfg": { "lr": 0.008, "eta": 0.08 }, "observed_min_dist_mean": 2.4003629982471466, "observed_min_dist_per_seed": [ 2.2287771701812744, 2.3035190105438232, 2.4954094886779785, 2.462498426437378, 2.388439178466797, 2.276618480682373, 2.310865640640259, 2.73677659034729 ] }, { "cfg": { "lr": 0.008, "eta": 0.2 }, "observed_min_dist_mean": 2.4003797471523285, "observed_min_dist_per_seed": [ 2.2287838459014893, 2.3035221099853516, 2.495425224304199, 2.462512731552124, 2.3884472846984863, 2.2766220569610596, 2.310927629470825, 2.7367970943450928 ] } ], "predicted_order": "eta .02 < .08 < .20", "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.008, "eta": 0.02 }, "mean": 7.273632645606995, "std": 0.5744234790485494, "per_seed": [ 6.92377233505249, 7.258182048797607, 6.877320289611816, 7.141030311584473, 6.306039810180664, 7.486922264099121, 8.12838363647461, 8.067410469055176 ] }, { "cfg": { "lr": 0.008, "eta": 0.08 }, "mean": 7.273632645606995, "std": 0.5744234790485494, "per_seed": [ 6.92377233505249, 7.258182048797607, 6.877320289611816, 7.141030311584473, 6.306039810180664, 7.486922264099121, 8.12838363647461, 8.067410469055176 ] }, { "cfg": { "lr": 0.008, "eta": 0.2 }, "mean": 7.273632645606995, "std": 0.5744234790485494, "per_seed": [ 6.92377233505249, 7.258182048797607, 6.877320289611816, 7.141030311584473, 6.306039810180664, 7.486922264099121, 8.12838363647461, 8.067410469055176 ] } ], "protocol_note": "Tabular is the built-in regularization/optimizer track; both systems use the identical bottleneck MLP and differ only by the signature loss." }