{ "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001, "rank": 8 }, "sweep": [ { "cfg": { "lr": 0.001, "rank": 8 }, "mean": 0.4039061442017555 }, { "cfg": { "lr": 0.003, "rank": 8 }, "mean": 0.5307872667908669 }, { "cfg": { "lr": 0.006, "rank": 8 }, "mean": 0.8058461993932724 } ], "full": { "mean": 0.4480689875781536, "std": 0.08669399607049459, "per_seed": [ 0.4437996447086334, 0.3383534550666809, 0.37107908725738525, 0.4623923897743225, 0.6176453828811646, 0.3899054229259491, 0.5426207780838013, 0.41875573992729187 ], "n": 8 }, "selected_cfg_full": { "mean": 0.4480689875781536, "std": 0.08669399607049459, "per_seed": [ 0.4437996447086334, 0.3383534550666809, 0.37107908725738525, 0.4623923897743225, 0.6176453828811646, 0.3899054229259491, 0.5426207780838013, 0.41875573992729187 ], "n": 8 } }, "idea": { "mean": 0.4980953820049763, "std": 0.0717662616842552, "per_seed": [ 0.5194478631019592, 0.45840978622436523, 0.43587931990623474, 0.6198630928993225, 0.5728811025619507, 0.39179709553718567, 0.535282552242279, 0.45120224356651306 ], "n": 8 }, "comparison": { "delta_mean": 0.05002639442682266, "idea_wins": 2, "n_pairs": 8, "per_seed_diffs": [ 0.0756482183933258, 0.12005633115768433, 0.06480023264884949, 0.157470703125, -0.04476428031921387, 0.0018916726112365723, -0.007338225841522217, 0.03244650363922119 ], "p_value": 0.08665, "mde": 0.05673288695634186, "mde_rel_pct": 12.661641070717113, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "prediction": "trained low-rank attention remains row-stochastic and shared-marginal, with O(nr) state", "observed": { "row_u": 2.086162567138672e-07, "row_v": 2.2351741790771484e-07, "shared_col": 2.5033950805664062e-06, "factor_entries": 520, "dense_entries": 1024, "predicted_storage_ratio": 1.9692307692307693, "observed_storage_ratio": 1.9692307692307693, "confirmed": true }, "confirmed": true }, "protocol_notes": { "matched_track": "sequence multi-token forecast", "shared_architecture": "same input/position/FFN/head; only attention operator differs", "n_train": 400, "epochs": 8, "idea_grid": [ [ { "mean": 0.4980953820049763, "std": 0.0717662616842552, "per_seed": [ 0.5194478631019592, 0.45840978622436523, 0.43587931990623474, 0.6198630928993225, 0.5728811025619507, 0.39179709553718567, 0.535282552242279, 0.45120224356651306 ], "n": 8 }, { "lr": 0.001, "rank": 8 } ], [ { "mean": 0.6111128553748131, "std": 0.07747015035751928, "per_seed": [ 0.6425154209136963, 0.5512837767601013, 0.5704087018966675, 0.7150149941444397, 0.646016538143158, 0.5375900864601135, 0.7234078645706177, 0.5026654601097107 ], "n": 8 }, { "lr": 0.003, "rank": 8 } ], [ { "mean": 0.9795129522681236, "std": 0.22563627392238808, "per_seed": [ 0.9576879739761353, 0.7885317802429199, 1.4408782720565796, 1.1196062564849854, 0.7925991415977478, 0.8517841100692749, 1.1472877264022827, 0.7377283573150635 ], "n": 8 }, { "lr": 0.006, "rank": 8 } ] ] } }