Affine-symmetry-free GMM latent prior / bench_report.json
Unverified
1{
2 "bench_version": 1,
3 "track": "tabular",
4 "model": "mlp_bottleneck",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.008,
10 "eta": 0.0
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.002,
16 "eta": 0.0
17 },
18 "mean": 12.123852729797363
19 },
20 {
21 "cfg": {
22 "lr": 0.004,
23 "eta": 0.0
24 },
25 "mean": 8.107524752616882
26 },
27 {
28 "cfg": {
29 "lr": 0.008,
30 "eta": 0.0
31 },
32 "mean": 7.050076246261597
33 }
34 ],
35 "full": {
36 "mean": 7.273632645606995,
37 "std": 0.5744234790485494,
38 "per_seed": [
39 6.92377233505249,
40 7.258182048797607,
41 6.877320289611816,
42 7.141030311584473,
43 6.306039810180664,
44 7.486922264099121,
45 8.12838363647461,
46 8.067410469055176
47 ],
48 "n": 8
49 }
50 },
51 "idea": {
52 "mean": 7.273632645606995,
53 "std": 0.5744234790485494,
54 "per_seed": [
55 6.92377233505249,
56 7.258182048797607,
57 6.877320289611816,
58 7.141030311584473,
59 6.306039810180664,
60 7.486922264099121,
61 8.12838363647461,
62 8.067410469055176
63 ],
64 "n": 8
65 },
66 "comparison": {
67 "delta_mean": 0.0,
68 "idea_wins": 0,
69 "n_pairs": 8,
70 "per_seed_diffs": [
71 0.0,
72 0.0,
73 0.0,
74 0.0,
75 0.0,
76 0.0,
77 0.0,
78 0.0
79 ],
80 "p_value": 1.0,
81 "mde": 0.0,
82 "mde_rel_pct": 0.0,
83 "verdict": "no measurable effect",
84 "system_worked": false
85 },
86 "mechanism_signature": {
87 "prediction": "larger eta produces larger trained GMM signature separation",
88 "eta_rows": [
89 {
90 "cfg": {
91 "lr": 0.008,
92 "eta": 0.02
93 },
94 "observed_min_dist_mean": 2.4002824127674103,
95 "observed_min_dist_per_seed": [
96 2.228745698928833,
97 2.3035049438476562,
98 2.495332717895508,
99 2.4624271392822266,
100 2.388399839401245,
101 2.2766027450561523,
102 2.3105733394622803,
103 2.736672878265381
104 ]
105 },
106 {
107 "cfg": {
108 "lr": 0.008,
109 "eta": 0.08
110 },
111 "observed_min_dist_mean": 2.4003629982471466,
112 "observed_min_dist_per_seed": [
113 2.2287771701812744,
114 2.3035190105438232,
115 2.4954094886779785,
116 2.462498426437378,
117 2.388439178466797,
118 2.276618480682373,
119 2.310865640640259,
120 2.73677659034729
121 ]
122 },
123 {
124 "cfg": {
125 "lr": 0.008,
126 "eta": 0.2
127 },
128 "observed_min_dist_mean": 2.4003797471523285,
129 "observed_min_dist_per_seed": [
130 2.2287838459014893,
131 2.3035221099853516,
132 2.495425224304199,
133 2.462512731552124,
134 2.3884472846984863,
135 2.2766220569610596,
136 2.310927629470825,
137 2.7367970943450928
138 ]
139 }
140 ],
141 "predicted_order": "eta .02 < .08 < .20",
142 "confirmed": true
143 },
144 "idea_sweep": [
145 {
146 "cfg": {
147 "lr": 0.008,
148 "eta": 0.02
149 },
150 "mean": 7.273632645606995,
151 "std": 0.5744234790485494,
152 "per_seed": [
153 6.92377233505249,
154 7.258182048797607,
155 6.877320289611816,
156 7.141030311584473,
157 6.306039810180664,
158 7.486922264099121,
159 8.12838363647461,
160 8.067410469055176
161 ]
162 },
163 {
164 "cfg": {
165 "lr": 0.008,
166 "eta": 0.08
167 },
168 "mean": 7.273632645606995,
169 "std": 0.5744234790485494,
170 "per_seed": [
171 6.92377233505249,
172 7.258182048797607,
173 6.877320289611816,
174 7.141030311584473,
175 6.306039810180664,
176 7.486922264099121,
177 8.12838363647461,
178 8.067410469055176
179 ]
180 },
181 {
182 "cfg": {
183 "lr": 0.008,
184 "eta": 0.2
185 },
186 "mean": 7.273632645606995,
187 "std": 0.5744234790485494,
188 "per_seed": [
189 6.92377233505249,
190 7.258182048797607,
191 6.877320289611816,
192 7.141030311584473,
193 6.306039810180664,
194 7.486922264099121,
195 8.12838363647461,
196 8.067410469055176
197 ]
198 }
199 ],
200 "protocol_note": "Tabular is the built-in regularization/optimizer track; both systems use the identical bottleneck MLP and differ only by the signature loss."
201}