{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny_shared_activation", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "epochs": 20 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 20 }, "mean": 17.79831099510193 }, { "cfg": { "lr": 0.003, "epochs": 20 }, "mean": 13.153547525405884 }, { "cfg": { "lr": 0.01, "epochs": 20 }, "mean": 7.754182696342468 } ], "full": { "mean": 7.931941092014313, "std": 0.8101161551333251, "per_seed": [ 7.2100510597229, 8.814193725585938, 7.362153053283691, 7.630332946777344, 6.520580291748047, 8.472823143005371, 8.71557903289795, 8.729815483093262 ], "n": 8 }, "union_grid": [ { "lr": 0.001, "epochs": 20 }, { "lr": 0.003, "epochs": 20 }, { "lr": 0.01, "epochs": 20 } ] }, "idea": { "mean": 25.546241760253906, "std": 1.397921331795095, "per_seed": [ 26.91761589050293, 25.963476181030273, 26.16190528869629, 22.51058578491211, 25.61777687072754, 26.621234893798828, 24.128700256347656, 26.448638916015625 ], "n": 8, "best_cfg": { "lr": 0.01, "epochs": 20 } }, "comparison": { "delta_mean": 17.614300668239594, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 19.70756483078003, 17.149282455444336, 18.799752235412598, 14.880252838134766, 19.097196578979492, 18.148411750793457, 15.413121223449707, 17.718823432922363 ], "p_value": 0.0081, "mde": 1.4419949288736407, "mde_rel_pct": 18.17959705128681, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "idea_sweep": [ { "cfg": { "lr": 0.001, "epochs": 20 }, "mean": 136.8510456085205 }, { "cfg": { "lr": 0.003, "epochs": 20 }, "mean": 72.42067241668701 }, { "cfg": { "lr": 0.01, "epochs": 20 }, "mean": 25.3883957862854 } ], "selected_cfg": { "lr": 0.01, "epochs": 20 }, "mechanism_signature": { "prediction": "adjacent local gain ratio is sigma=2; output changes under input scaling", "sigma_predicted": 2.0, "slope_ratios_observed_trained_model": [ 0.49992549419403076, 0.5001490116119385, 0.5 ], "median_ratio_observed": 0.5, "input_scale_2_output_abs_ratio": 1.0001696348190308, "probe_test_mse": 26.91761589050293, "confirmed": false }, "track_choice": "tabular: activation is an MLP scalar nonlinearity; Friedman regression supplies the matched MLP setting." } }