Exact Multi-Output Linear-Probe Coreset / bench_report.json
Mechanism confirmed, baseline not beaten
1{
2 "bench_version": 1,
3 "track": "tabular",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.003,
10 "epochs": 10
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "epochs": 10
17 },
18 "mean": 7.220232725842463
19 },
20 {
21 "cfg": {
22 "lr": 0.003,
23 "epochs": 10
24 },
25 "mean": 7.203192111793281
26 },
27 {
28 "cfg": {
29 "lr": 0.01,
30 "epochs": 10
31 },
32 "mean": 7.781077191271562
33 }
34 ],
35 "full": {
36 "mean": 7.136611352879902,
37 "std": 0.942271126563791,
38 "per_seed": [
39 6.400019744607703,
40 5.8703252148798235,
41 7.538179208923518,
42 9.004244278762076,
43 7.2321342357711815,
44 6.160751975873095,
45 7.162807354308972,
46 7.724428809912834
47 ],
48 "n": 8
49 }
50 },
51 "idea": {
52 "mean": 7.225184601729713,
53 "std": 0.8393894535095389,
54 "per_seed": [
55 7.0379122900681095,
56 5.62935485908627,
57 7.541481788855412,
58 8.681194260406958,
59 6.721253156819834,
60 7.15528821919516,
61 7.9675634823270185,
62 7.06742875707894
63 ],
64 "n": 8,
65 "best_cfg": {
66 "lr": 0.001,
67 "epochs": 10
68 }
69 },
70 "comparison": {
71 "delta_mean": 0.08857324884981232,
72 "idea_wins": 4,
73 "n_pairs": 8,
74 "per_seed_diffs": [
75 0.6378925454604065,
76 -0.24097035579355364,
77 0.0033025799318942006,
78 -0.3230500183551186,
79 -0.5108810789513472,
80 0.9945362433220657,
81 0.8047561280180462,
82 -0.6570000528338946
83 ],
84 "p_value": 0.6962,
85 "mde": 0.5322157802089068,
86 "mde_rel_pct": 7.457541876567748,
87 "verdict": "no significant win",
88 "system_worked": false
89 },
90 "mechanism_signature": {
91 "prediction": "support <= (m+1)r and near exact normal-equation preservation at trained embedding scale",
92 "predicted_support_bound": 69.0,
93 "observed_mean_support": 69.0,
94 "observed_mean_normal_residual_rel": 1.3569193552173906e-11,
95 "confirmed": true,
96 "idea_sweep": [
97 {
98 "cfg": {
99 "lr": 0.001,
100 "epochs": 10
101 },
102 "mean": 7.222485799604187
103 },
104 {
105 "cfg": {
106 "lr": 0.003,
107 "epochs": 10
108 },
109 "mean": 7.255961504565217
110 },
111 {
112 "cfg": {
113 "lr": 0.01,
114 "epochs": 10
115 },
116 "mean": 7.751476359508167
117 }
118 ],
119 "per_seed": [
120 {
121 "support": 64,
122 "rank": 32,
123 "normal_residual_rel": 2.8504796746390255e-11,
124 "embedding_dim": 64,
125 "train_final_loss": 166.79879333496095
126 },
127 {
128 "support": 70,
129 "rank": 35,
130 "normal_residual_rel": 2.7548421303293732e-12,
131 "embedding_dim": 64,
132 "train_final_loss": 169.28177185058593
133 },
134 {
135 "support": 76,
136 "rank": 38,
137 "normal_residual_rel": 3.293662572703943e-11,
138 "embedding_dim": 64,
139 "train_final_loss": 163.3371533203125
140 },
141 {
142 "support": 64,
143 "rank": 32,
144 "normal_residual_rel": 6.169931764135759e-12,
145 "embedding_dim": 64,
146 "train_final_loss": 165.8473614501953
147 },
148 {
149 "support": 70,
150 "rank": 35,
151 "normal_residual_rel": 2.255497874617923e-11,
152 "embedding_dim": 64,
153 "train_final_loss": 161.77953857421875
154 },
155 {
156 "support": 70,
157 "rank": 35,
158 "normal_residual_rel": 1.1350919642293515e-11,
159 "embedding_dim": 64,
160 "train_final_loss": 174.27471069335937
161 },
162 {
163 "support": 72,
164 "rank": 36,
165 "normal_residual_rel": 1.0363493393420043e-12,
166 "embedding_dim": 64,
167 "train_final_loss": 166.05378295898439
168 },
169 {
170 "support": 66,
171 "rank": 33,
172 "normal_residual_rel": 3.2451043216816745e-12,
173 "embedding_dim": 64,
174 "train_final_loss": 191.73027954101562
175 }
176 ]
177 },
178 "runtime_sec": null
179}