# Стенд-проверка (stage-2) · промт оператора: (универсальный) Ответ агента: { "worked": false, "confidence": 9, "verdict": "Implemented a matched sequence-level benchmark: dense learned token mixing versus a trainable orthogonal butterfly mixer with identical encoder structure, optimizer, learning-rate grid, and eight paired seeds. The mechanism signature was confirmed at neural-network scale (norm ratio 1.0 and inverse error 1.19e-6), but the idea had worse test MSE (0.598316 versus 0.476622), paired delta +0.121694, and permutation p=0.1299, so there was no significant win.", "metrics": { "baseline": "Best dense token mixer, lr=0.001, epochs=6: test MSE mean 0.476622, std 0.099342 over 8 seeds.", "idea": "Best isometric butterfly, lr=0.001, epochs=6: test MSE mean 0.598316, std 0.165879 over 8 seeds; paired delta +0.121694, p=0.1299, 2/8 wins.", "mechanism_signature": "confirmed=true; predicted norm ratio 1.0, observed trained-model ratio 1.0, observed adjoint inverse max error 1.19e-6; baseline observed norm ratio 0.502587." }, "bench_report": { "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001, "epochs": 6, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 6, "weight_decay": 0.0 }, "mean": 0.46786613017320633 }, { "cfg": { "lr": 0.003, "epochs": 6, "weight_decay": 0.0 }, "mean": 0.5299046412110329 }, { "cfg": { "lr": 0.006, "epochs": 6, "weight_decay": 0.0 }, "mean": 0.7419369965791702 } ], "full": { "mean": 0.4766220450401306, "std": 0.09934194575564281, "per_seed": [ 0.5715442299842834, 0.39496564865112305, 0.3930272161960602, 0.5119274258613586, 0.4745565354824066, 0.4187285602092743, 0.6776894927024841, 0.37053725123405457 ], "n": 8 } }, "idea": { "mean": 0.5983163416385651, "std": 0.16587939812424876, "per_seed": [ 0.3822963237762451, 0.5229498744010925, 0.8081433773040771, 0.863442063331604, 0.6520702838897705, 0.45361945033073425, 0.6645830869674683, 0.4394262731075287 ], "n": 8 }, "comparison": { "delta_mean": 0.12169429659843445, "idea_wins": 2, "n_pairs": 8, "per_seed_diffs": [ -0.18924790620803833, 0.12798422574996948, 0.41511616110801697, 0.35151463747024536, 0.1775137484073639, 0.03489089012145996, -0.01310640573501587, 0.06888902187347412 ], "p_value": 0.1299, "mde": 0.16337849985483555, "mde_rel_pct": 34.27841862435872, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "prediction": "trained isometric token mixer preserves feature-token Euclidean norm and has exact adjoint inverse", "predicted_norm_ratio": 1.0, "observed_norm_ratio_seed0": 1.0, "observed_inverse_max_error_seed0": 1.1920928955078125e-06, "baseline_observed_norm_ratio_seed0": 0.5025865435600281, "confirmed": true, "trained_model_metric_seed0": 0.3822963237762451 } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_bench.py", "files": [ "isometric_mixer.py", "stage2_bench.py", "bench_report.json" ], "limitations": "Only the built-in sequence forecast track was tested; CIFAR vision, tabular, and dynamics tracks were not tested. The implementation uses a real orthogonal butterfly specialization rather than full complex U(2) QFT phases, and no reliable wall-clock or FLOP speedup measurement was included.", "system_verdict": "partial", "practical_verdict": "inconclusive", "mechanism_ok": 1, "system_judged": true }