# Стенд-проверка (stage-2) · промт оператора: (универсальный) Ответ агента: { "worked": false, "confidence": 9, "verdict": "The registered built-in sequence track was rerun end-to-end with matched transformer systems, an 8-seed paired protocol, tuned baseline learning-rate sweep, and a three-setting idea rank sweep. The dyadic system slightly improved mean test MSE, but the paired permutation test was non-significant, so there is no demonstrated benchmark win. The trained-model mechanism signature was confirmed quantitatively: observed rank 4 <= predicted bound 5 and observed relative cross-output error 3.26e-05 <= 1e-3.", "metrics": { "baseline": "sequence/transformer_tiny, tuned lr=0.001; 8-seed mean test MSE=0.3629476018, std=0.0543452814.", "idea": "rank=4 at shared lr=0.001; 8-seed mean test MSE=0.3599541374, std=0.0551822606; paired delta=-0.0029934645, 5/8 wins, permutation p=0.53235." }, "bench_report": { "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001, "temperature": 1.0 }, "sweep": [ { "cfg": { "lr": 0.001, "temperature": 1.0 }, "mean": 0.34783465415239334 }, { "cfg": { "lr": 0.003, "temperature": 1.0 }, "mean": 0.3491433709859848 }, { "cfg": { "lr": 0.005, "temperature": 1.0 }, "mean": 0.40824612975120544 } ], "full": { "mean": 0.36294760182499886, "std": 0.054345281417173805, "per_seed": [ 0.39175504446029663, 0.3038984537124634, 0.30141177773475647, 0.3942733407020569, 0.35095956921577454, 0.3010490834712982, 0.4579026699066162, 0.4023308753967285 ], "n": 8 } }, "idea": { "mean": 0.3599541373550892, "std": 0.05518226062931197, "per_seed": [ 0.3880409896373749, 0.2888491451740265, 0.32456186413764954, 0.3811890184879303, 0.3370722830295563, 0.29420310258865356, 0.4586992561817169, 0.40701743960380554 ], "n": 8 }, "comparison": { "delta_mean": -0.002993464469909668, "idea_wins": 5, "n_pairs": 8, "per_seed_diffs": [ -0.003714054822921753, -0.01504930853843689, 0.023150086402893066, -0.013084322214126587, -0.013887286186218262, -0.006845980882644653, 0.000796586275100708, 0.004686564207077026 ], "p_value": 0.53235, "mde": 0.010661430606466927, "mde_rel_pct": 2.9374572397939445, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "epsilon": 0.001, "predicted_rank_bound": 5, "observed_rank": 4, "trained_model_cross_output_relative_error": 3.261449819547124e-05, "predicted_error_bound": 0.001, "confirmed": true }, "protocol_notes": { "paired_seeds": [ 0, 1, 2, 3, 4, 5, 6, 7 ], "epochs": 20, "architecture_difference_only": "dense self-attention versus within-side dense attention plus cached dyadic Hankel cross-boundary branch" } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_bench.py", "files": [ "stage2_bench.py", "bench_report.json" ], "limitations": "Only the registered sequence forecast track was tested at window length 32, 400 training samples, 200 test samples, and 20 epochs. Wall-clock speed, FLOPs, KV-cache memory, longer contexts, multiple dyadic scales, learned gates, causal masking, and language-model perplexity were not measured.", "system_verdict": "partial", "practical_verdict": "no_effect", "mechanism_ok": 1, "system_judged": true }