{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 17.79831099510193 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 13.153547525405884 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "mean": 7.754182696342468 } ], "full": { "mean": 7.931941092014313, "std": 0.8101161551333251, "per_seed": [ 7.2100510597229, 8.814193725585938, 7.362153053283691, 7.630332946777344, 6.520580291748047, 8.472823143005371, 8.71557903289795, 8.729815483093262 ], "n": 8 } }, "idea": { "mean": 8.868400931358337, "std": 0.7219192817226784, "per_seed": [ 9.187010765075684, 8.92486572265625, 8.406270980834961, 8.585136413574219, 7.358145713806152, 9.900330543518066, 9.11246395111084, 9.472983360290527 ], "n": 8, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 44.67299127578735 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 12.883334636688232 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "mean": 8.775820970535278 } ] }, "comparison": { "delta_mean": 0.9364598393440247, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 1.9769597053527832, 0.1106719970703125, 1.0441179275512695, 0.954803466796875, 0.8375654220581055, 1.4275074005126953, 0.3968849182128906, 0.7431678771972656 ], "p_value": 0.0081, "mde": 0.4850827510411753, "mde_rel_pct": 6.115561694344213, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "prediction": "idea starts in recovered spectral subspace, so projection energy is higher", "predicted_vs_observed": { "observed_energy_ratio": 1.7969543217617925, "threshold": 1.2 }, "confirmed": true, "trained_model_measurements": [ { "seed": 0, "spectral_gap": 2.3793046737761143, "baseline_projection_energy": 0.153251051902771, "idea_projection_energy": 0.28242650628089905, "idea_metric": 9.187010765075684 }, { "seed": 1, "spectral_gap": 2.345487753974355, "baseline_projection_energy": 0.14754755795001984, "idea_projection_energy": 0.2536274790763855, "idea_metric": 8.92486572265625 }, { "seed": 2, "spectral_gap": 2.5917119317759125, "baseline_projection_energy": 0.1287820041179657, "idea_projection_energy": 0.2661108076572418, "idea_metric": 8.406270980834961 }, { "seed": 3, "spectral_gap": 2.0604149370605582, "baseline_projection_energy": 0.15506194531917572, "idea_projection_energy": 0.28266391158103943, "idea_metric": 8.585136413574219 }, { "seed": 4, "spectral_gap": 2.544887882094244, "baseline_projection_energy": 0.17158180475234985, "idea_projection_energy": 0.24406076967716217, "idea_metric": 7.358145713806152 }, { "seed": 5, "spectral_gap": 2.366815131166324, "baseline_projection_energy": 0.1343323141336441, "idea_projection_energy": 0.26110315322875977, "idea_metric": 9.900330543518066 }, { "seed": 6, "spectral_gap": 2.2032378706059492, "baseline_projection_energy": 0.16026736795902252, "idea_projection_energy": 0.2490236610174179, "idea_metric": 9.11246395111084 }, { "seed": 7, "spectral_gap": 2.286019756494266, "baseline_projection_energy": 0.13112203776836395, "idea_projection_energy": 0.2628439664840698, "idea_metric": 9.472983360290527 } ] }, "protocol": { "paired_seeds": [ 0, 1, 2, 3, 4, 5, 6, 7 ], "n_train": 400, "n_test": 400, "epochs": 20, "batch": 128, "common_grid": [ { "lr": 0.001, "weight_decay": 0.0 }, { "lr": 0.003, "weight_decay": 0.0 }, { "lr": 0.01, "weight_decay": 0.0 } ], "track_rationale": "Initialization intervention uses the designated tabular MLP track." } }