Lipschitz-Free Metric Pooling / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "sequence",
4 "model": "transformer_tiny_pooling_mvp",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.003,
10 "epochs": 12,
11 "batch": 128
12 },
13 "sweep": [
14 {
15 "cfg": {
16 "lr": 0.0015,
17 "epochs": 12,
18 "batch": 128
19 },
20 "mean": 1.030422881245613
21 },
22 {
23 "cfg": {
24 "lr": 0.003,
25 "epochs": 12,
26 "batch": 128
27 },
28 "mean": 1.0044431388378143
29 },
30 {
31 "cfg": {
32 "lr": 0.006,
33 "epochs": 12,
34 "batch": 128
35 },
36 "mean": 1.0057344734668732
37 }
38 ],
39 "full": {
40 "mean": 1.0108022689819336,
41 "std": 0.09233493114632767,
42 "per_seed": [
43 1.135109543800354,
44 0.8252689242362976,
45 1.0580546855926514,
46 0.9993394017219543,
47 1.0295724868774414,
48 1.0314586162567139,
49 1.09066903591156,
50 0.9169454574584961
51 ],
52 "n": 8
53 }
54 },
55 "idea": {
56 "mean": 1.0283051505684853,
57 "std": 0.09182080119670853,
58 "per_seed": [
59 1.1634190082550049,
60 0.8420974612236023,
61 1.050006628036499,
62 1.0190545320510864,
63 1.0613138675689697,
64 1.0465973615646362,
65 1.1009020805358887,
66 0.9430502653121948
67 ],
68 "n": 8,
69 "selected_cfg": {
70 "lr": 0.006,
71 "epochs": 12,
72 "batch": 128
73 }
74 },
75 "comparison": {
76 "delta_mean": 0.017502881586551666,
77 "idea_wins": 1,
78 "n_pairs": 8,
79 "per_seed_diffs": [
80 0.02830946445465088,
81 0.016828536987304688,
82 -0.008048057556152344,
83 0.01971513032913208,
84 0.03174138069152832,
85 0.015138745307922363,
86 0.010233044624328613,
87 0.02610480785369873
88 ],
89 "p_value": 0.0163,
90 "mde": 0.010529986179047253,
91 "mde_rel_pct": 1.0417454038417338,
92 "verdict": "idea worse (significant)",
93 "system_worked": false
94 },
95 "idea_sweep": [
96 {
97 "cfg": {
98 "lr": 0.0015,
99 "epochs": 12,
100 "batch": 128
101 },
102 "mean": 1.091338686645031,
103 "std": 0.09665476674907689,
104 "per_seed": [
105 1.2205655574798584,
106 0.9110400080680847,
107 1.1126540899276733,
108 1.0519979000091553,
109 1.12910795211792,
110 1.1222410202026367,
111 1.1943774223327637,
112 0.9887255430221558
113 ]
114 },
115 {
116 "cfg": {
117 "lr": 0.003,
118 "epochs": 12,
119 "batch": 128
120 },
121 "mean": 1.075037308037281,
122 "std": 0.09951274952114578,
123 "per_seed": [
124 1.2106199264526367,
125 0.8868147134780884,
126 1.1060532331466675,
127 1.03895902633667,
128 1.1129647493362427,
129 1.103129506111145,
130 1.173069715499878,
131 0.9686875939369202
132 ]
133 },
134 {
135 "cfg": {
136 "lr": 0.006,
137 "epochs": 12,
138 "batch": 128
139 },
140 "mean": 1.0283051505684853,
141 "std": 0.09182080119670853,
142 "per_seed": [
143 1.1634190082550049,
144 0.8420974612236023,
145 1.050006628036499,
146 1.0190545320510864,
147 1.0613138675689697,
148 1.0465973615646362,
149 1.1009020805358887,
150 0.9430502653121948
151 ]
152 }
153 ],
154 "selection_seeds": [
155 0,
156 1,
157 2,
158 3
159 ],
160 "epochs": 12,
161 "batch": 128,
162 "parameter_counts": {
163 "baseline": 321,
164 "idea": 337
165 },
166 "structural_match": "sequence-level window forecasting with token-set pooling",
167 "mechanism_signature": {
168 "quantity": "trained probe D_hat versus independent 1D Wasserstein-1",
169 "predicted": "D_hat <= W1 for every pair; positive geometric association",
170 "observed_mean_D_hat": 0.027728637424297632,
171 "observed_mean_W1": 0.31382585523523404,
172 "mean_ratio_D_hat_over_W1": 0.09807194932021986,
173 "pearson_correlation": 0.12651039453842908,
174 "violation_fraction": 0.0,
175 "confirmed": false
176 }
177}