Sublinear-expander sparse attention / bench_report.json

Unverified

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "sequence",
  4  "model": "transformer_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.0015,
 10      "epochs": 10,
 11      "degree": 8
 12    },
 13    "sweep": [
 14      {
 15        "cfg": {
 16          "lr": 0.0015,
 17          "epochs": 10,
 18          "degree": 8
 19        },
 20        "mean": 0.3802499696612358
 21      },
 22      {
 23        "cfg": {
 24          "lr": 0.003,
 25          "epochs": 10,
 26          "degree": 8
 27        },
 28        "mean": 0.4271381199359894
 29      },
 30      {
 31        "cfg": {
 32          "lr": 0.006,
 33          "epochs": 10,
 34          "degree": 8
 35        },
 36        "mean": 0.5638246461749077
 37      }
 38    ],
 39    "full": {
 40      "mean": 0.37510566785931587,
 41      "std": 0.05712290975923622,
 42      "per_seed": [
 43        0.45052582025527954,
 44        0.3252289593219757,
 45        0.38266339898109436,
 46        0.36258170008659363,
 47        0.40209755301475525,
 48        0.29846498370170593,
 49        0.46274900436401367,
 50        0.3165339231491089
 51      ],
 52      "n": 8
 53    }
 54  },
 55  "idea": {
 56    "mean": 0.376313004642725,
 57    "std": 0.05670116290415251,
 58    "per_seed": [
 59      0.46788883209228516,
 60      0.3152424097061157,
 61      0.38778379559516907,
 62      0.3687755763530731,
 63      0.4005262553691864,
 64      0.3052693009376526,
 65      0.4445805251598358,
 66      0.32043734192848206
 67    ],
 68    "n": 8
 69  },
 70  "comparison": {
 71    "delta_mean": 0.0012073367834091187,
 72    "idea_wins": 3,
 73    "n_pairs": 8,
 74    "per_seed_diffs": [
 75      0.017363011837005615,
 76      -0.009986549615859985,
 77      0.005120396614074707,
 78      0.006193876266479492,
 79      -0.0015712976455688477,
 80      0.006804317235946655,
 81      -0.018168479204177856,
 82      0.003903418779373169
 83    ],
 84    "p_value": 0.77295,
 85    "mde": 0.009204338351285793,
 86    "mde_rel_pct": 2.453798793234417,
 87    "verdict": "no measurable effect",
 88    "system_worked": false
 89  },
 90  "mechanism_signature": {
 91    "graph": "random_regular_plus_self",
 92    "degree_nonself": 8,
 93    "attention_layers": 2,
 94    "idea_lr_sweep": [
 95      {
 96        "cfg": {
 97          "lr": 0.0015,
 98          "epochs": 10,
 99          "degree": 8
100        },
101        "result": {
102          "mean": 0.376313004642725,
103          "std": 0.05670116290415251,
104          "per_seed": [
105            0.46788883209228516,
106            0.3152424097061157,
107            0.38778379559516907,
108            0.3687755763530731,
109            0.4005262553691864,
110            0.3052693009376526,
111            0.4445805251598358,
112            0.32043734192848206
113          ],
114          "n": 8
115        }
116      },
117      {
118        "cfg": {
119          "lr": 0.003,
120          "epochs": 10,
121          "degree": 8
122        },
123        "result": {
124          "mean": 0.4302271008491516,
125          "std": 0.07651031513028718,
126          "per_seed": [
127            0.4481615424156189,
128            0.48518460988998413,
129            0.38120338320732117,
130            0.44692790508270264,
131            0.4615558385848999,
132            0.32852280139923096,
133            0.5656229853630066,
134            0.3246377408504486
135          ],
136          "n": 8
137        }
138      },
139      {
140        "cfg": {
141          "lr": 0.006,
142          "epochs": 10,
143          "degree": 8
144        },
145        "result": {
146          "mean": 0.5617959015071392,
147          "std": 0.21138960001988505,
148          "per_seed": [
149            0.5091874003410339,
150            0.671311616897583,
151            0.3863237202167511,
152            0.542673647403717,
153            0.42686569690704346,
154            0.3991197943687439,
155            1.0728341341018677,
156            0.48605120182037354
157          ],
158          "n": 8
159        }
160      }
161    ],
162    "route_growth": {
163      "layers": 2,
164      "degree_nonself": 8,
165      "predicted_reachable_tokens": 17,
166      "observed_gradient_sensitive_tokens": 17,
167      "predicted_growth_by_layer": [
168        1,
169        9,
170        17
171      ],
172      "gradient_threshold": 0.00012559862434864045,
173      "measurement": "gradient of trained final-layer token-0 latent wrt input positions",
174      "confirmed": true
175    }
176  },
177  "protocol_notes": {
178    "dataset_sizes": [
179      400,
180      400
181    ],
182    "matched_seeds": [
183      0,
184      1,
185      2,
186      3,
187      4,
188      5,
189      6,
190      7
191    ],
192    "structural_match": "sequence forecast requires multi-token correlations; attention is the sole architectural change",
193    "baseline_sweep_union_lrs": [
194      0.0015,
195      0.003,
196      0.006
197    ],
198    "idea_best_cfg": {
199      "lr": 0.0015,
200      "epochs": 10,
201      "degree": 8
202    }
203  }
204}