# Стенд-проверка (stage-2) · промт оператора: (универсальный) Ответ агента: { "worked": false, "confidence": 9, "verdict": "Rank-8 hidden-state projection slightly improved the dynamics test MSE, but the paired permutation test was not significant, so the idea did not produce a protocol-counted win. The trained-model mechanism signature was confirmed: observed effective rank 8.0 matched the predicted rank.", "metrics": { "baseline": "Dense GRUCell, tuned lr=0.006: test MSE mean 0.002105819425196387 over 8 seeds.", "idea": "Rank-8 projected GRUCell, lr=0.006: test MSE mean 0.0020776986493729055; paired delta -2.812077582348138e-05; permutation p=0.15145." }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006 }, "sweep": [ { "cfg": { "lr": 0.0015 }, "mean": 0.004987414460629225 }, { "cfg": { "lr": 0.003 }, "mean": 0.0034615940821822733 }, { "cfg": { "lr": 0.006 }, "mean": 0.0018282315868418664 } ], "full": { "mean": 0.002105819425196387, "std": 0.000389436566226016, "per_seed": [ 0.002004395006224513, 0.001437882543541491, 0.0015748648438602686, 0.002295783953741193, 0.0024020641576498747, 0.0024898042902350426, 0.0020851334556937218, 0.0025566271506249905 ], "n": 8 } }, "idea": { "mean": 0.0020776986493729055, "std": 0.00037367759212413065, "per_seed": [ 0.0020221038721501827, 0.001397693995386362, 0.0016216225922107697, 0.002313514007255435, 0.0023468395229429007, 0.002421593526378274, 0.0019859536550939083, 0.0025122680235654116 ], "n": 8 }, "comparison": { "delta_mean": -2.812077582348138e-05, "idea_wins": 5, "n_pairs": 8, "per_seed_diffs": [ 1.770886592566967e-05, -4.0188548155128956e-05, 4.675774835050106e-05, 1.7730053514242172e-05, -5.522463470697403e-05, -6.821076385676861e-05, -9.917980059981346e-05, -4.4359127059578896e-05 ], "p_value": 0.15145, "mde": 4.193884781531501e-05, "mde_rel_pct": 1.9915690449765808, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "predicted_rank": 8, "observed_effective_rank_mean": 8.0, "predicted_factor_scalar_ratio": 5.882352941176471, "observed_projection_defect_mean": 1.149918068676925e-05, "confirmed": true }, "idea_sweep": [ { "rank": 8, "lr": 0.0015, "mean": 0.0052895165426889434, "std": 0.0027286265828909257 }, { "rank": 8, "lr": 0.003, "mean": 0.0029902143724029884, "std": 0.0018055794197106632 }, { "rank": 8, "lr": 0.006, "mean": 0.0020776986493729055, "std": 0.00037367759212413065 }, { "rank": 16, "lr": 0.0015, "mean": 0.005181030704989098, "std": 0.0027043397351147937 }, { "rank": 16, "lr": 0.003, "mean": 0.0029607619217131287, "std": 0.0017947703875401172 }, { "rank": 16, "lr": 0.006, "mean": 0.002110591303789988, "std": 0.00038488654224676564 }, { "rank": 32, "lr": 0.0015, "mean": 0.0051692417182493955, "std": 0.002700498589073299 }, { "rank": 32, "lr": 0.003, "mean": 0.002949635687400587, "std": 0.0017909695309575413 }, { "rank": 32, "lr": 0.006, "mean": 0.0021058720449218526, "std": 0.00038964953095754133 } ], "protocol_notes": { "n_train": 400, "n_test": 200, "epochs": 12, "matched_architecture": "same GRUCell(3,64)+linear head; only hidden-state rank projection differs", "baseline_lr_union": [ 0.0015, 0.003, 0.006 ], "idea_ranks": [ 8, 16, 32 ], "idea_best_cfg": { "rank": 8, "lr": 0.006 }, "baseline_best_lr": 0.006 } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_stage2.py", "files": [ "bench_stage2.py", "bench_report.json" ], "limitations": "Direct peak GPU memory, wall-clock speed, reversible QR/projector-splitting updates, checkpointing, and reconstructed adjoint gradients were not measured; the factor-state ratio is a storage proxy.", "system_verdict": "partial", "practical_verdict": "no_effect", "mechanism_ok": 1, "system_judged": true }