{ "bench_version": 1, "track": "vision", "model": "cnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.8887499868869781 }, { "cfg": { "lr": 0.003 }, "mean": 0.8899999856948853 }, { "cfg": { "lr": 0.01 }, "mean": 0.8912499845027924 } ], "full": { "mean": 0.8762499839067459, "std": 0.024843258193087, "per_seed": [ 0.8949999809265137, 0.8849999904632568, 0.8999999761581421, 0.875, 0.8299999833106995, 0.9049999713897705, 0.8449999690055847, 0.875 ], "n": 8 } }, "idea": { "mean": 0.8762499839067459, "std": 0.024843258193087, "per_seed": [ 0.8949999809265137, 0.8849999904632568, 0.8999999761581421, 0.875, 0.8299999833106995, 0.9049999713897705, 0.8449999690055847, 0.875 ], "n": 8 }, "comparison": { "delta_mean": 0.0, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0 ], "p_value": 1.0, "mde": 0.0, "mde_rel_pct": 0.0, "verdict": "no measurable effect", "system_worked": false }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "result": { "mean": 0.8762499839067459, "std": 0.024843258193087, "per_seed": [ 0.8949999809265137, 0.8849999904632568, 0.8999999761581421, 0.875, 0.8299999833106995, 0.9049999713897705, 0.8449999690055847, 0.875 ], "n": 8 } }, { "cfg": { "lr": 0.003 }, "result": { "mean": 0.877499982714653, "std": 0.029895645776799453, "per_seed": [ 0.9049999713897705, 0.8799999952316284, 0.9049999713897705, 0.8700000047683716, 0.8499999642372131, 0.9049999713897705, 0.8899999856948853, 0.8149999976158142 ], "n": 8 } }, { "cfg": { "lr": 0.01 }, "result": { "mean": 0.877499982714653, "std": 0.02958039211486051, "per_seed": [ 0.8949999809265137, 0.8799999952316284, 0.9149999618530273, 0.875, 0.824999988079071, 0.9149999618530273, 0.8449999690055847, 0.8700000047683716 ], "n": 8 } } ], "protocol_note": "Verifier pruning is inference-time only; training and standard test metric are unchanged systems.", "mechanism_signature": { "fixed_sign_fraction": 0.5423773306387443, "max_fixed_substitution_error": 0.0, "predicted_reduction_fraction": 0.5423773306387443, "fixed_sign_mean": 959721.5, "unstable_mean": 809750.5, "total_relu_instances_mean": 1769472.0, "confirmed": true }, "experiment_settings": { "epochs": 3, "n_train": 400, "n_test": 200, "batch": 128, "lr_union": [ 0.001, 0.003, 0.01 ], "seeds": [ 0, 1, 2, 3, 4, 5, 6, 7 ] } }