Sublinear-expander sparse attention / bench_report.json
Unverified
1{
2 "bench_version": 1,
3 "track": "sequence",
4 "model": "transformer_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.0015,
10 "epochs": 10,
11 "degree": 8
12 },
13 "sweep": [
14 {
15 "cfg": {
16 "lr": 0.0015,
17 "epochs": 10,
18 "degree": 8
19 },
20 "mean": 0.3802499696612358
21 },
22 {
23 "cfg": {
24 "lr": 0.003,
25 "epochs": 10,
26 "degree": 8
27 },
28 "mean": 0.4271381199359894
29 },
30 {
31 "cfg": {
32 "lr": 0.006,
33 "epochs": 10,
34 "degree": 8
35 },
36 "mean": 0.5638246461749077
37 }
38 ],
39 "full": {
40 "mean": 0.37510566785931587,
41 "std": 0.05712290975923622,
42 "per_seed": [
43 0.45052582025527954,
44 0.3252289593219757,
45 0.38266339898109436,
46 0.36258170008659363,
47 0.40209755301475525,
48 0.29846498370170593,
49 0.46274900436401367,
50 0.3165339231491089
51 ],
52 "n": 8
53 }
54 },
55 "idea": {
56 "mean": 0.376313004642725,
57 "std": 0.05670116290415251,
58 "per_seed": [
59 0.46788883209228516,
60 0.3152424097061157,
61 0.38778379559516907,
62 0.3687755763530731,
63 0.4005262553691864,
64 0.3052693009376526,
65 0.4445805251598358,
66 0.32043734192848206
67 ],
68 "n": 8
69 },
70 "comparison": {
71 "delta_mean": 0.0012073367834091187,
72 "idea_wins": 3,
73 "n_pairs": 8,
74 "per_seed_diffs": [
75 0.017363011837005615,
76 -0.009986549615859985,
77 0.005120396614074707,
78 0.006193876266479492,
79 -0.0015712976455688477,
80 0.006804317235946655,
81 -0.018168479204177856,
82 0.003903418779373169
83 ],
84 "p_value": 0.77295,
85 "mde": 0.009204338351285793,
86 "mde_rel_pct": 2.453798793234417,
87 "verdict": "no measurable effect",
88 "system_worked": false
89 },
90 "mechanism_signature": {
91 "graph": "random_regular_plus_self",
92 "degree_nonself": 8,
93 "attention_layers": 2,
94 "idea_lr_sweep": [
95 {
96 "cfg": {
97 "lr": 0.0015,
98 "epochs": 10,
99 "degree": 8
100 },
101 "result": {
102 "mean": 0.376313004642725,
103 "std": 0.05670116290415251,
104 "per_seed": [
105 0.46788883209228516,
106 0.3152424097061157,
107 0.38778379559516907,
108 0.3687755763530731,
109 0.4005262553691864,
110 0.3052693009376526,
111 0.4445805251598358,
112 0.32043734192848206
113 ],
114 "n": 8
115 }
116 },
117 {
118 "cfg": {
119 "lr": 0.003,
120 "epochs": 10,
121 "degree": 8
122 },
123 "result": {
124 "mean": 0.4302271008491516,
125 "std": 0.07651031513028718,
126 "per_seed": [
127 0.4481615424156189,
128 0.48518460988998413,
129 0.38120338320732117,
130 0.44692790508270264,
131 0.4615558385848999,
132 0.32852280139923096,
133 0.5656229853630066,
134 0.3246377408504486
135 ],
136 "n": 8
137 }
138 },
139 {
140 "cfg": {
141 "lr": 0.006,
142 "epochs": 10,
143 "degree": 8
144 },
145 "result": {
146 "mean": 0.5617959015071392,
147 "std": 0.21138960001988505,
148 "per_seed": [
149 0.5091874003410339,
150 0.671311616897583,
151 0.3863237202167511,
152 0.542673647403717,
153 0.42686569690704346,
154 0.3991197943687439,
155 1.0728341341018677,
156 0.48605120182037354
157 ],
158 "n": 8
159 }
160 }
161 ],
162 "route_growth": {
163 "layers": 2,
164 "degree_nonself": 8,
165 "predicted_reachable_tokens": 17,
166 "observed_gradient_sensitive_tokens": 17,
167 "predicted_growth_by_layer": [
168 1,
169 9,
170 17
171 ],
172 "gradient_threshold": 0.00012559862434864045,
173 "measurement": "gradient of trained final-layer token-0 latent wrt input positions",
174 "confirmed": true
175 }
176 },
177 "protocol_notes": {
178 "dataset_sizes": [
179 400,
180 400
181 ],
182 "matched_seeds": [
183 0,
184 1,
185 2,
186 3,
187 4,
188 5,
189 6,
190 7
191 ],
192 "structural_match": "sequence forecast requires multi-token correlations; attention is the sole architectural change",
193 "baseline_sweep_union_lrs": [
194 0.0015,
195 0.003,
196 0.006
197 ],
198 "idea_best_cfg": {
199 "lr": 0.0015,
200 "epochs": 10,
201 "degree": 8
202 }
203 }
204}