{ "bench_version": 1, "track": "vision", "model": "cnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "sweep": { "best_cfg": { "lr": 0.001 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.7862499803304672 }, { "cfg": { "lr": 0.003 }, "mean": 0.8006249815225601 }, { "cfg": { "lr": 0.006 }, "mean": 0.8237500041723251 } ], "full": { "mean": 0.7849999815225601, "std": 0.03665719838879184, "per_seed": [ 0.7874999642372131, 0.75, 0.8349999785423279, 0.7724999785423279, 0.8274999856948853, 0.8174999952316284, 0.7249999642372131, 0.7649999856948853 ], "n": 8 } }, "full": { "mean": 0.7849999815225601, "std": 0.03665719838879184, "per_seed": [ 0.7874999642372131, 0.75, 0.8349999785423279, 0.7724999785423279, 0.8274999856948853, 0.8174999952316284, 0.7249999642372131, 0.7649999856948853 ], "n": 8 } }, "idea": { "lr": 0.001, "per_seed": [ 0.7899999618530273, 0.7699999809265137, 0.8399999737739563, 0.762499988079071, 0.824999988079071, 0.8075000047683716, 0.7475000023841858, 0.7549999952316284 ], "mean": 0.7871874868869781 }, "comparison": { "delta_mean": 0.00218750536441803, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 0.002499997615814209, 0.019999980926513672, 0.004999995231628418, -0.009999990463256836, -0.002499997615814209, -0.009999990463256836, 0.022500038146972656, -0.009999990463256836 ], "p_value": 0.64985, "mde": 0.01097274108925552, "mde_rel_pct": 1.3978014455456615, "verdict": "no measurable effect", "system_worked": false }, "math_check": { "matrix_frobenius_residual": 0.0, "max_abs_energy_error": 1.4210854715202004e-14, "relative_energy_rmse": 1.4996245561724451e-16, "random_relative_rmse": 0.32222904703868205, "random_mean_relative_std": 0.3208364891796913 }, "idea_grid": [ { "lr": 0.001, "mean": 0.7871874868869781 }, { "lr": 0.003, "mean": 0.7893749848008156 }, { "lr": 0.006, "mean": 0.8271874785423279 } ], "mechanism_signature": { "prediction": "exact modeled energy has zero estimator variance; random signs have nonzero variance", "predicted_exact_relative_rmse": 0.0, "observed_mean_exact_relative_rmse": 5.16787475035585e-08, "observed_mean_random_relative_std": 0.3647565320134163, "per_seed": [ { "seed": 0, "exact_rel_rmse": 0.0, "random_rel_std": 0.33480483293533325 }, { "seed": 1, "exact_rel_rmse": 1.1523898280074718e-07, "random_rel_std": 0.3534063696861267 }, { "seed": 2, "exact_rel_rmse": 0.0, "random_rel_std": 0.44275858998298645 }, { "seed": 3, "exact_rel_rmse": 0.0, "random_rel_std": 0.4704761505126953 }, { "seed": 4, "exact_rel_rmse": 0.0, "random_rel_std": 0.3139871060848236 }, { "seed": 5, "exact_rel_rmse": 1.5191113789114752e-07, "random_rel_std": 0.28184041380882263 }, { "seed": 6, "exact_rel_rmse": 1.4627985933657328e-07, "random_rel_std": 0.2919972240924835 }, { "seed": 7, "exact_rel_rmse": 0.0, "random_rel_std": 0.42878156900405884 } ], "confirmed": true }, "protocol_note": "Vision selected because the intervention is activation/architecture normalization; duplicate CNN layers and identical trainer settings, with only energy statistic changed." }