Balanced design attention / report_bench_2026-08-31T123351.md
Failed on benchmark
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "Balanced-design attention was implemented and evaluated end-to-end on the registered sequence forecasting track. It improved mean test MSE numerically, 0.30736 versus 0.33212, but the paired permutation test was not significant at p=0.1218, so the required significant-win criterion is not met. The trained-model routing signature confirmed zero pair-coverage variance, but this does not establish a statistically significant task improvement.", "metrics": { "baseline": "Sequence test MSE mean 0.33212270587682724, std 0.052525560059948226, 8 seeds; tuned lr=0.001, epochs=12.", "idea": "Sequence test MSE mean 0.3073607422411442, std 0.05354461640119265, 8 seeds; selected lr=0.001, epochs=12; paired delta=-0.02476196363568306; permutation p=0.1218; 4/8 wins; routing pair-coverage variance=0.0." }, "how_to_run": "/home/maxwelhelp/main/bin/python3 balanced_design_bench.py", "files": [ "balanced_design_bench.py", "bench_report.json" ], "limitations": "Only the registered sequence forecasting track was tested. WikiText-2, long-range copy, optimized fused kernels, throughput, and autoregressive KV-cache behavior were not tested. The exact 2-(32,2,1) design uses 496 pair blocks, so it does not reduce attention compute at sequence length 32; the local implementation is also not a production fused sparse kernel.", "bench_report": { "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001, "epochs": 12 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 12 }, "mean": 0.3171548619866371 }, { "cfg": { "lr": 0.003, "epochs": 12 }, "mean": 0.33575212955474854 }, { "cfg": { "lr": 0.006, "epochs": 12 }, "mean": 0.3609168827533722 } ], "full": { "mean": 0.33212270587682724, "std": 0.052525560059948226, "per_seed": [ 0.34580686688423157, 0.2720120847225189, 0.27966615557670593, 0.37113434076309204, 0.28781864047050476, 0.3107385039329529, 0.4378826916217804, 0.3519223630428314 ], "n": 8 }, "union_grid": [ { "lr": 0.001, "epochs": 12 }, { "lr": 0.003, "epochs": 12 }, { "lr": 0.006, "epochs": 12 } ] }, "idea": { "mean": 0.3073607422411442, "std": 0.05354461640119265, "per_seed": [ 0.3493795692920685, 0.2742547392845154, 0.2889987826347351, 0.37771299481391907, 0.25186100602149963, 0.2312282919883728, 0.38401901721954346, 0.3014315366744995 ], "n": 8, "selected_cfg": { "lr": 0.001, "epochs": 12 } }, "comparison": { "delta_mean": -0.02476196363568306, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 0.003572702407836914, 0.00224265456199646, 0.009332627058029175, 0.006578654050827026, -0.03595763444900513, -0.07951021194458008, -0.05386367440223694, -0.05049082636833191 ], "p_value": 0.1218, "mde": 0.028806811988049977, "mde_rel_pct": 8.673544891186518, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "design": { "predicted_pair_coverage": 1.0, "observed_attention_pair_mean": 0.40865393000985345, "observed_attention_pair_variance": 0.0008423293021837351, "routing_pair_coverage_variance": 0.0, "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.001, "epochs": 12 }, "mean": 0.3225979581475258 }, { "cfg": { "lr": 0.001, "epochs": 12 }, "mean": 0.32260219752788544 }, { "cfg": { "lr": 0.006, "epochs": 12 }, "mean": 0.324721522629261 } ], "selected_cfg": { "lr": 0.001, "epochs": 12 } } }, "system_verdict": "failed", "practical_verdict": "inconclusive", "mechanism_ok": 0, "system_judged": true }