Sound active-neuron pruning for SDP verification / bench_report.json
Mechanism confirmed, baseline not beaten
1{
2 "bench_version": 1,
3 "track": "vision",
4 "model": "cnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.001
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.001
15 },
16 "mean": 0.8887499868869781
17 },
18 {
19 "cfg": {
20 "lr": 0.003
21 },
22 "mean": 0.8899999856948853
23 },
24 {
25 "cfg": {
26 "lr": 0.01
27 },
28 "mean": 0.8912499845027924
29 }
30 ],
31 "full": {
32 "mean": 0.8762499839067459,
33 "std": 0.024843258193087,
34 "per_seed": [
35 0.8949999809265137,
36 0.8849999904632568,
37 0.8999999761581421,
38 0.875,
39 0.8299999833106995,
40 0.9049999713897705,
41 0.8449999690055847,
42 0.875
43 ],
44 "n": 8
45 }
46 },
47 "idea": {
48 "mean": 0.8762499839067459,
49 "std": 0.024843258193087,
50 "per_seed": [
51 0.8949999809265137,
52 0.8849999904632568,
53 0.8999999761581421,
54 0.875,
55 0.8299999833106995,
56 0.9049999713897705,
57 0.8449999690055847,
58 0.875
59 ],
60 "n": 8
61 },
62 "comparison": {
63 "delta_mean": 0.0,
64 "idea_wins": 0,
65 "n_pairs": 8,
66 "per_seed_diffs": [
67 0.0,
68 0.0,
69 0.0,
70 0.0,
71 0.0,
72 0.0,
73 0.0,
74 0.0
75 ],
76 "p_value": 1.0,
77 "mde": 0.0,
78 "mde_rel_pct": 0.0,
79 "verdict": "no measurable effect",
80 "system_worked": false
81 },
82 "idea_sweep": [
83 {
84 "cfg": {
85 "lr": 0.001
86 },
87 "result": {
88 "mean": 0.8762499839067459,
89 "std": 0.024843258193087,
90 "per_seed": [
91 0.8949999809265137,
92 0.8849999904632568,
93 0.8999999761581421,
94 0.875,
95 0.8299999833106995,
96 0.9049999713897705,
97 0.8449999690055847,
98 0.875
99 ],
100 "n": 8
101 }
102 },
103 {
104 "cfg": {
105 "lr": 0.003
106 },
107 "result": {
108 "mean": 0.877499982714653,
109 "std": 0.029895645776799453,
110 "per_seed": [
111 0.9049999713897705,
112 0.8799999952316284,
113 0.9049999713897705,
114 0.8700000047683716,
115 0.8499999642372131,
116 0.9049999713897705,
117 0.8899999856948853,
118 0.8149999976158142
119 ],
120 "n": 8
121 }
122 },
123 {
124 "cfg": {
125 "lr": 0.01
126 },
127 "result": {
128 "mean": 0.877499982714653,
129 "std": 0.02958039211486051,
130 "per_seed": [
131 0.8949999809265137,
132 0.8799999952316284,
133 0.9149999618530273,
134 0.875,
135 0.824999988079071,
136 0.9149999618530273,
137 0.8449999690055847,
138 0.8700000047683716
139 ],
140 "n": 8
141 }
142 }
143 ],
144 "protocol_note": "Verifier pruning is inference-time only; training and standard test metric are unchanged systems.",
145 "mechanism_signature": {
146 "fixed_sign_fraction": 0.5423773306387443,
147 "max_fixed_substitution_error": 0.0,
148 "predicted_reduction_fraction": 0.5423773306387443,
149 "fixed_sign_mean": 959721.5,
150 "unstable_mean": 809750.5,
151 "total_relu_instances_mean": 1769472.0,
152 "confirmed": true
153 },
154 "experiment_settings": {
155 "epochs": 3,
156 "n_train": 400,
157 "n_test": 200,
158 "batch": 128,
159 "lr_union": [
160 0.001,
161 0.003,
162 0.01
163 ],
164 "seeds": [
165 0,
166 1,
167 2,
168 3,
169 4,
170 5,
171 6,
172 7
173 ]
174 }
175}