Affine-symmetry-free GMM latent prior / bench_report.json

Unverified

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_bottleneck",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.008,
 10      "eta": 0.0
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.002,
 16          "eta": 0.0
 17        },
 18        "mean": 12.123852729797363
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.004,
 23          "eta": 0.0
 24        },
 25        "mean": 8.107524752616882
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.008,
 30          "eta": 0.0
 31        },
 32        "mean": 7.050076246261597
 33      }
 34    ],
 35    "full": {
 36      "mean": 7.273632645606995,
 37      "std": 0.5744234790485494,
 38      "per_seed": [
 39        6.92377233505249,
 40        7.258182048797607,
 41        6.877320289611816,
 42        7.141030311584473,
 43        6.306039810180664,
 44        7.486922264099121,
 45        8.12838363647461,
 46        8.067410469055176
 47      ],
 48      "n": 8
 49    }
 50  },
 51  "idea": {
 52    "mean": 7.273632645606995,
 53    "std": 0.5744234790485494,
 54    "per_seed": [
 55      6.92377233505249,
 56      7.258182048797607,
 57      6.877320289611816,
 58      7.141030311584473,
 59      6.306039810180664,
 60      7.486922264099121,
 61      8.12838363647461,
 62      8.067410469055176
 63    ],
 64    "n": 8
 65  },
 66  "comparison": {
 67    "delta_mean": 0.0,
 68    "idea_wins": 0,
 69    "n_pairs": 8,
 70    "per_seed_diffs": [
 71      0.0,
 72      0.0,
 73      0.0,
 74      0.0,
 75      0.0,
 76      0.0,
 77      0.0,
 78      0.0
 79    ],
 80    "p_value": 1.0,
 81    "mde": 0.0,
 82    "mde_rel_pct": 0.0,
 83    "verdict": "no measurable effect",
 84    "system_worked": false
 85  },
 86  "mechanism_signature": {
 87    "prediction": "larger eta produces larger trained GMM signature separation",
 88    "eta_rows": [
 89      {
 90        "cfg": {
 91          "lr": 0.008,
 92          "eta": 0.02
 93        },
 94        "observed_min_dist_mean": 2.4002824127674103,
 95        "observed_min_dist_per_seed": [
 96          2.228745698928833,
 97          2.3035049438476562,
 98          2.495332717895508,
 99          2.4624271392822266,
100          2.388399839401245,
101          2.2766027450561523,
102          2.3105733394622803,
103          2.736672878265381
104        ]
105      },
106      {
107        "cfg": {
108          "lr": 0.008,
109          "eta": 0.08
110        },
111        "observed_min_dist_mean": 2.4003629982471466,
112        "observed_min_dist_per_seed": [
113          2.2287771701812744,
114          2.3035190105438232,
115          2.4954094886779785,
116          2.462498426437378,
117          2.388439178466797,
118          2.276618480682373,
119          2.310865640640259,
120          2.73677659034729
121        ]
122      },
123      {
124        "cfg": {
125          "lr": 0.008,
126          "eta": 0.2
127        },
128        "observed_min_dist_mean": 2.4003797471523285,
129        "observed_min_dist_per_seed": [
130          2.2287838459014893,
131          2.3035221099853516,
132          2.495425224304199,
133          2.462512731552124,
134          2.3884472846984863,
135          2.2766220569610596,
136          2.310927629470825,
137          2.7367970943450928
138        ]
139      }
140    ],
141    "predicted_order": "eta .02 < .08 < .20",
142    "confirmed": true
143  },
144  "idea_sweep": [
145    {
146      "cfg": {
147        "lr": 0.008,
148        "eta": 0.02
149      },
150      "mean": 7.273632645606995,
151      "std": 0.5744234790485494,
152      "per_seed": [
153        6.92377233505249,
154        7.258182048797607,
155        6.877320289611816,
156        7.141030311584473,
157        6.306039810180664,
158        7.486922264099121,
159        8.12838363647461,
160        8.067410469055176
161      ]
162    },
163    {
164      "cfg": {
165        "lr": 0.008,
166        "eta": 0.08
167      },
168      "mean": 7.273632645606995,
169      "std": 0.5744234790485494,
170      "per_seed": [
171        6.92377233505249,
172        7.258182048797607,
173        6.877320289611816,
174        7.141030311584473,
175        6.306039810180664,
176        7.486922264099121,
177        8.12838363647461,
178        8.067410469055176
179      ]
180    },
181    {
182      "cfg": {
183        "lr": 0.008,
184        "eta": 0.2
185      },
186      "mean": 7.273632645606995,
187      "std": 0.5744234790485494,
188      "per_seed": [
189        6.92377233505249,
190        7.258182048797607,
191        6.877320289611816,
192        7.141030311584473,
193        6.306039810180664,
194        7.486922264099121,
195        8.12838363647461,
196        8.067410469055176
197      ]
198    }
199  ],
200  "protocol_note": "Tabular is the built-in regularization/optimizer track; both systems use the identical bottleneck MLP and differ only by the signature loss."
201}