# Стенд-проверка (stage-2) · промт оператора: (универсальный) Ответ агента: { "worked": false, "confidence": 9, "verdict": "Transverse Synchrony Training was evaluated on the registered actuated-pendulum dynamics track using matched rnn_small systems, a tuned baseline sweep, and a three-setting idea sweep. The idea reduced mean test MSE from 0.00341626 to 0.00239230 and won 7 of 8 pairs, but the paired permutation p-value was 0.1057, so there was no significant win. The scalar stability check passed, while the trained-model residual signature was not confirmed because the residual ratio was 2.5987 rather than below 1.", "metrics": { "baseline": "lr=0.01, epochs=10; mean test MSE=0.003416259671212174", "idea": "lr=0.01, k=0.2, epochs=10; mean test MSE=0.002392302827502135", "comparison": "delta_mean=-0.0010239568437100388; idea_wins=7/8; p_value=0.1057; verdict=no significant win" }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_bench.py", "files": [ "stage2_bench.py", "bench_report.json" ], "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "epochs": 10, "k": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 10, "k": 0.0 }, "result": { "mean": 0.18850252870470285, "std": 0.09844521870499254, "per_seed": [ 0.2647189795970917, 0.2680639326572418, 0.05886165052652359, 0.11395366489887238, 0.17393222451210022, 0.36622312664985657, 0.08291985094547272, 0.17934679985046387 ], "n": 8 } }, { "cfg": { "lr": 0.003, "epochs": 10, "k": 0.0 }, "result": { "mean": 0.010191879409831017, "std": 0.004210917599331909, "per_seed": [ 0.005354649852961302, 0.005063467659056187, 0.012440202757716179, 0.017969045788049698, 0.01297833863645792, 0.007027691230177879, 0.012447123415768147, 0.008254515938460827 ], "n": 8 } }, { "cfg": { "lr": 0.01, "epochs": 10, "k": 0.0 }, "result": { "mean": 0.003416259671212174, "std": 0.0007808474461952083, "per_seed": [ 0.0038322454784065485, 0.003838583827018738, 0.004478443879634142, 0.0032678311690688133, 0.003483000909909606, 0.0030872197821736336, 0.0016336649423465133, 0.0037090873811393976 ], "n": 8 } } ], "full": { "mean": 0.003416259671212174, "std": 0.0007808474461952083, "per_seed": [ 0.0038322454784065485, 0.003838583827018738, 0.004478443879634142, 0.0032678311690688133, 0.003483000909909606, 0.0030872197821736336, 0.0016336649423465133, 0.0037090873811393976 ], "n": 8 } }, "idea": { "mean": 0.002392302827502135, "std": 0.0015345376265231531, "per_seed": [ 0.0014558794209733605, 0.002402462065219879, 0.0027061353903263807, 0.001609530416317284, 0.0019438277231529355, 0.0027547706849873066, 0.0003203718806616962, 0.005945445038378239 ], "n": 8 }, "comparison": { "delta_mean": -0.0010239568437100388, "idea_wins": 7, "n_pairs": 8, "per_seed_diffs": [ -0.002376366057433188, -0.0014361217617988586, -0.0017723084893077612, -0.0016583007527515292, -0.0015391731867566705, -0.000332449097186327, -0.001313293061684817, 0.002236357657238841 ], "p_value": 0.1057, "mde": 0.0012000360968298309, "mde_rel_pct": 35.12719208502169, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "math_check": { "predicted_boundary": 0.1499999999999999, "observed_boundary": 0.1499999999999999, "max_abs_slope_error": 1.1102230246251565e-16, "passed": true }, "idea_sweep": [ { "cfg": { "lr": 0.001, "epochs": 10, "k": 0.05 }, "result": { "mean": 0.22941934876143932, "std": 0.10325000200323692, "per_seed": [ 0.29764461517333984, 0.26714083552360535, 0.0848923772573471, 0.19724982976913452, 0.210689976811409, 0.4287005066871643, 0.09971201419830322, 0.24932463467121124 ], "n": 8 } }, { "cfg": { "lr": 0.003, "epochs": 10, "k": 0.1 }, "result": { "mean": 0.010696535755414516, "std": 0.004646521743264224, "per_seed": [ 0.003972996026277542, 0.006377296522259712, 0.015556089580059052, 0.014911942183971405, 0.009622597135603428, 0.01697155274450779, 0.005784574430435896, 0.012375237420201302 ], "n": 8 } }, { "cfg": { "lr": 0.01, "epochs": 10, "k": 0.2 }, "result": { "mean": 0.002392302827502135, "std": 0.0015345376265231531, "per_seed": [ 0.0014558794209733605, 0.002402462065219879, 0.0027061353903263807, 0.001609530416317284, 0.0019438277231529355, 0.0027547706849873066, 0.0003203718806616962, 0.005945445038378239 ], "n": 8 } } ], "mechanism_signature": { "prediction": "positive coupling should reduce latent synchrony residuals; transverse map has multiplier near 1-k", "trained_test_mse": 0.0014558794209733605, "observed_residual_start": 0.8435457944869995, "observed_residual_final": 2.192122459411621, "observed_residual_ratio": 2.5987000038831995, "observed_input_output_jacobian": 0.40619704127311707, "confirmed": false } } }, "limitations": "The prescribed README path was absent, although the bench package and registered dynamics track were available. The experiment used 10 epochs, 400 training samples, one recurrent architecture, and an MVP fixed reference latent system; it did not compute a full QR transverse Lyapunov exponent.", "system_verdict": "failed", "practical_verdict": "inconclusive", "mechanism_ok": 0, "system_judged": true }