Exact Multi-Output Linear-Probe Coreset / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.003,
 10      "epochs": 10
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "epochs": 10
 17        },
 18        "mean": 7.220232725842463
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "epochs": 10
 24        },
 25        "mean": 7.203192111793281
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.01,
 30          "epochs": 10
 31        },
 32        "mean": 7.781077191271562
 33      }
 34    ],
 35    "full": {
 36      "mean": 7.136611352879902,
 37      "std": 0.942271126563791,
 38      "per_seed": [
 39        6.400019744607703,
 40        5.8703252148798235,
 41        7.538179208923518,
 42        9.004244278762076,
 43        7.2321342357711815,
 44        6.160751975873095,
 45        7.162807354308972,
 46        7.724428809912834
 47      ],
 48      "n": 8
 49    }
 50  },
 51  "idea": {
 52    "mean": 7.225184601729713,
 53    "std": 0.8393894535095389,
 54    "per_seed": [
 55      7.0379122900681095,
 56      5.62935485908627,
 57      7.541481788855412,
 58      8.681194260406958,
 59      6.721253156819834,
 60      7.15528821919516,
 61      7.9675634823270185,
 62      7.06742875707894
 63    ],
 64    "n": 8,
 65    "best_cfg": {
 66      "lr": 0.001,
 67      "epochs": 10
 68    }
 69  },
 70  "comparison": {
 71    "delta_mean": 0.08857324884981232,
 72    "idea_wins": 4,
 73    "n_pairs": 8,
 74    "per_seed_diffs": [
 75      0.6378925454604065,
 76      -0.24097035579355364,
 77      0.0033025799318942006,
 78      -0.3230500183551186,
 79      -0.5108810789513472,
 80      0.9945362433220657,
 81      0.8047561280180462,
 82      -0.6570000528338946
 83    ],
 84    "p_value": 0.6962,
 85    "mde": 0.5322157802089068,
 86    "mde_rel_pct": 7.457541876567748,
 87    "verdict": "no significant win",
 88    "system_worked": false
 89  },
 90  "mechanism_signature": {
 91    "prediction": "support <= (m+1)r and near exact normal-equation preservation at trained embedding scale",
 92    "predicted_support_bound": 69.0,
 93    "observed_mean_support": 69.0,
 94    "observed_mean_normal_residual_rel": 1.3569193552173906e-11,
 95    "confirmed": true,
 96    "idea_sweep": [
 97      {
 98        "cfg": {
 99          "lr": 0.001,
100          "epochs": 10
101        },
102        "mean": 7.222485799604187
103      },
104      {
105        "cfg": {
106          "lr": 0.003,
107          "epochs": 10
108        },
109        "mean": 7.255961504565217
110      },
111      {
112        "cfg": {
113          "lr": 0.01,
114          "epochs": 10
115        },
116        "mean": 7.751476359508167
117      }
118    ],
119    "per_seed": [
120      {
121        "support": 64,
122        "rank": 32,
123        "normal_residual_rel": 2.8504796746390255e-11,
124        "embedding_dim": 64,
125        "train_final_loss": 166.79879333496095
126      },
127      {
128        "support": 70,
129        "rank": 35,
130        "normal_residual_rel": 2.7548421303293732e-12,
131        "embedding_dim": 64,
132        "train_final_loss": 169.28177185058593
133      },
134      {
135        "support": 76,
136        "rank": 38,
137        "normal_residual_rel": 3.293662572703943e-11,
138        "embedding_dim": 64,
139        "train_final_loss": 163.3371533203125
140      },
141      {
142        "support": 64,
143        "rank": 32,
144        "normal_residual_rel": 6.169931764135759e-12,
145        "embedding_dim": 64,
146        "train_final_loss": 165.8473614501953
147      },
148      {
149        "support": 70,
150        "rank": 35,
151        "normal_residual_rel": 2.255497874617923e-11,
152        "embedding_dim": 64,
153        "train_final_loss": 161.77953857421875
154      },
155      {
156        "support": 70,
157        "rank": 35,
158        "normal_residual_rel": 1.1350919642293515e-11,
159        "embedding_dim": 64,
160        "train_final_loss": 174.27471069335937
161      },
162      {
163        "support": 72,
164        "rank": 36,
165        "normal_residual_rel": 1.0363493393420043e-12,
166        "embedding_dim": 64,
167        "train_final_loss": 166.05378295898439
168      },
169      {
170        "support": 66,
171        "rank": 33,
172        "normal_residual_rel": 3.2451043216816745e-12,
173        "embedding_dim": 64,
174        "train_final_loss": 191.73027954101562
175      }
176    ]
177  },
178  "runtime_sec": null
179}