Projective Boundary Certificates for Neural Selective Prediction / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "epochs": 12,
 11      "alpha": 0.15
 12    },
 13    "sweep": [
 14      {
 15        "cfg": {
 16          "lr": 0.0015,
 17          "epochs": 12,
 18          "alpha": 0.05
 19        },
 20        "mean": 116.23149108886719
 21      },
 22      {
 23        "cfg": {
 24          "lr": 0.003,
 25          "epochs": 12,
 26          "alpha": 0.1
 27        },
 28        "mean": 29.072664737701416
 29      },
 30      {
 31        "cfg": {
 32          "lr": 0.006,
 33          "epochs": 12,
 34          "alpha": 0.15
 35        },
 36        "mean": 20.75340461730957
 37      }
 38    ],
 39    "full": {
 40      "mean": 20.881689310073853,
 41      "std": 2.8097707761369097,
 42      "per_seed": [
 43        24.462068557739258,
 44        22.150100708007812,
 45        18.394702911376953,
 46        18.006746292114258,
 47        16.289684295654297,
 48        22.511140823364258,
 49        21.119823455810547,
 50        24.119247436523438
 51      ],
 52      "n": 8
 53    }
 54  },
 55  "idea": {
 56    "mean": 20.881689310073853,
 57    "std": 2.8097707761369097,
 58    "per_seed": [
 59      24.462068557739258,
 60      22.150100708007812,
 61      18.394702911376953,
 62      18.006746292114258,
 63      16.289684295654297,
 64      22.511140823364258,
 65      21.119823455810547,
 66      24.119247436523438
 67    ],
 68    "n": 8
 69  },
 70  "comparison": {
 71    "delta_mean": 0.0,
 72    "idea_wins": 0,
 73    "n_pairs": 8,
 74    "per_seed_diffs": [
 75      0.0,
 76      0.0,
 77      0.0,
 78      0.0,
 79      0.0,
 80      0.0,
 81      0.0,
 82      0.0
 83    ],
 84    "p_value": 1.0,
 85    "mde": 0.0,
 86    "mde_rel_pct": 0.0,
 87    "verdict": "no measurable effect",
 88    "system_worked": false
 89  },
 90  "selection": {
 91    "baseline_grid": [
 92      {
 93        "lr": 0.0015,
 94        "epochs": 12,
 95        "alpha": 0.05
 96      },
 97      {
 98        "lr": 0.003,
 99        "epochs": 12,
100        "alpha": 0.1
101      },
102      {
103        "lr": 0.006,
104        "epochs": 12,
105        "alpha": 0.15
106      }
107    ],
108    "idea_grid": [
109      {
110        "lr": 0.0015,
111        "epochs": 12,
112        "alpha": 0.05
113      },
114      {
115        "lr": 0.003,
116        "epochs": 12,
117        "alpha": 0.1
118      },
119      {
120        "lr": 0.006,
121        "epochs": 12,
122        "alpha": 0.15
123      }
124    ],
125    "baseline_best": {
126      "lr": 0.006,
127      "epochs": 12,
128      "alpha": 0.15
129    },
130    "idea_best": {
131      "lr": 0.006,
132      "epochs": 12,
133      "alpha": 0.15
134    }
135  },
136  "structural_match": "Independent neural calibration residuals define a scalar acceptance set; explicit order-statistic boundary is the stated projective structure.",
137  "mechanism_signature": {
138    "prediction": "trained scalar residual order-statistic has K=1 and projective deletion; risk approximately Beta(1,n) mean",
139    "observed_mean": {
140      "boundary_size": 15.0,
141      "empirical_test_risk": 0.175,
142      "beta_predicted_mean_risk": 0.1485148514851485,
143      "deletion_projectivity": 0.85,
144      "deletion_equivalence": 0.99
145    },
146    "per_seed": [
147      {
148        "threshold": 6.851143836975098,
149        "boundary_size": 15,
150        "empirical_test_risk": 0.17,
151        "beta_predicted_mean_risk": 0.1485148514851485,
152        "deletion_projectivity": 0.85,
153        "deletion_equivalence": 0.99
154      },
155      {
156        "threshold": 5.987270355224609,
157        "boundary_size": 15,
158        "empirical_test_risk": 0.2,
159        "beta_predicted_mean_risk": 0.1485148514851485,
160        "deletion_projectivity": 0.85,
161        "deletion_equivalence": 0.99
162      },
163      {
164        "threshold": 5.549269676208496,
165        "boundary_size": 15,
166        "empirical_test_risk": 0.2175,
167        "beta_predicted_mean_risk": 0.1485148514851485,
168        "deletion_projectivity": 0.85,
169        "deletion_equivalence": 0.99
170      },
171      {
172        "threshold": 6.736217498779297,
173        "boundary_size": 15,
174        "empirical_test_risk": 0.115,
175        "beta_predicted_mean_risk": 0.1485148514851485,
176        "deletion_projectivity": 0.85,
177        "deletion_equivalence": 0.99
178      },
179      {
180        "threshold": 6.043928146362305,
181        "boundary_size": 15,
182        "empirical_test_risk": 0.14,
183        "beta_predicted_mean_risk": 0.1485148514851485,
184        "deletion_projectivity": 0.85,
185        "deletion_equivalence": 0.99
186      },
187      {
188        "threshold": 5.98091983795166,
189        "boundary_size": 15,
190        "empirical_test_risk": 0.235,
191        "beta_predicted_mean_risk": 0.1485148514851485,
192        "deletion_projectivity": 0.85,
193        "deletion_equivalence": 0.99
194      },
195      {
196        "threshold": 5.88011360168457,
197        "boundary_size": 15,
198        "empirical_test_risk": 0.225,
199        "beta_predicted_mean_risk": 0.1485148514851485,
200        "deletion_projectivity": 0.85,
201        "deletion_equivalence": 0.99
202      },
203      {
204        "threshold": 8.088789939880371,
205        "boundary_size": 15,
206        "empirical_test_risk": 0.0975,
207        "beta_predicted_mean_risk": 0.1485148514851485,
208        "deletion_projectivity": 0.85,
209        "deletion_equivalence": 0.99
210      }
211    ],
212    "confirmed": false
213  }
214}