# Стенд-проверка (stage-2) · промт оператора: (универсальный) Ответ агента: { "worked": false, "confidence": 9, "verdict": "Sign-Reset PI was tested on the registered built-in tabular track with the shared mlp_tiny architecture. Its best configuration was significantly worse than tuned momentum SGD on test MSE, despite frequent observed resets, so the system did not produce the promised benchmark win.", "metrics": { "baseline": "Tuned momentum SGD: mean test MSE 6.9946147203445435 over 8 seeds.", "idea": "Sign-Reset PI: mean test MSE 7.51734858751297 over 8 seeds; paired delta +0.5227338671684265; permutation p=0.0081; 0/8 paired wins; observed reset rate 0.6267857142857143." }, "bench_report": { "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.002, "momentum": 0.9 }, "sweep": [ { "cfg": { "lr": 0.0005, "momentum": 0.0 }, "mean": 15.173156976699829 }, { "cfg": { "lr": 0.0005, "momentum": 0.9 }, "mean": 7.033971428871155 }, { "cfg": { "lr": 0.001, "momentum": 0.0 }, "mean": 12.429494142532349 }, { "cfg": { "lr": 0.001, "momentum": 0.9 }, "mean": 6.920896649360657 }, { "cfg": { "lr": 0.0015, "momentum": 0.0 }, "mean": 10.261504888534546 }, { "cfg": { "lr": 0.0015, "momentum": 0.9 }, "mean": 6.831890940666199 }, { "cfg": { "lr": 0.002, "momentum": 0.0 }, "mean": 8.732401132583618 }, { "cfg": { "lr": 0.002, "momentum": 0.9 }, "mean": 6.79731810092926 }, { "cfg": { "lr": 0.003, "momentum": 0.0 }, "mean": 7.4249961376190186 }, { "cfg": { "lr": 0.003, "momentum": 0.9 }, "mean": 6.80940568447113 }, { "cfg": { "lr": 0.004, "momentum": 0.0 }, "mean": 7.365786075592041 }, { "cfg": { "lr": 0.004, "momentum": 0.9 }, "mean": 6.832672119140625 }, { "cfg": { "lr": 0.005, "momentum": 0.0 }, "mean": 8.720722794532776 }, { "cfg": { "lr": 0.005, "momentum": 0.9 }, "mean": 6.841493129730225 }, { "cfg": { "lr": 0.006, "momentum": 0.0 }, "mean": 12.199845552444458 }, { "cfg": { "lr": 0.006, "momentum": 0.9 }, "mean": 6.900767803192139 }, { "cfg": { "lr": 0.01, "momentum": 0.0 }, "mean": 15.477824091911316 }, { "cfg": { "lr": 0.01, "momentum": 0.9 }, "mean": 14.715186953544617 }, { "cfg": { "lr": 0.02, "momentum": 0.0 }, "mean": 11.526971578598022 }, { "cfg": { "lr": 0.02, "momentum": 0.9 }, "mean": 21.544694423675537 } ], "full": { "mean": 6.9946147203445435, "std": 0.5462041094541707, "per_seed": [ 7.059720993041992, 6.078768253326416, 6.975253105163574, 7.075530052185059, 6.368229866027832, 6.91272497177124, 7.652469158172607, 7.834221363067627 ], "n": 8 } }, "idea": { "mean": 7.51734858751297, "std": 0.6549113710902053, "per_seed": [ 7.288843154907227, 7.805213451385498, 7.1009440422058105, 7.081621170043945, 6.880852222442627, 7.159562110900879, 7.777229309082031, 9.044523239135742 ], "n": 8, "cfg": { "lr": 0.004, "kp": 1.0, "ki": 0.2 }, "diagnostics": [ { "metric": 7.288843154907227, "resets": 89, "mean_integral_norm": 15.755404067039489, "final_integral_norm": 0.0 }, { "metric": 7.805213451385498, "resets": 86, "mean_integral_norm": 15.125472933905465, "final_integral_norm": 0.0 }, { "metric": 7.1009440422058105, "resets": 85, "mean_integral_norm": 14.83641802413123, "final_integral_norm": 0.0 }, { "metric": 7.081621170043945, "resets": 94, "mean_integral_norm": 16.25910394702639, "final_integral_norm": 0.0 }, { "metric": 6.880852222442627, "resets": 101, "mean_integral_norm": 13.210206178256444, "final_integral_norm": 10.246424674987793 }, { "metric": 7.159562110900879, "resets": 86, "mean_integral_norm": 14.10479433962277, "final_integral_norm": 0.0 }, { "metric": 7.777229309082031, "resets": 84, "mean_integral_norm": 13.188805731705257, "final_integral_norm": 0.0 }, { "metric": 9.044523239135742, "resets": 77, "mean_integral_norm": 15.760829194954463, "final_integral_norm": 16.458066940307617 } ] }, "comparison": { "delta_mean": 0.5227338671684265, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.22912216186523438, 1.726445198059082, 0.12569093704223633, 0.006091117858886719, 0.5126223564147949, 0.24683713912963867, 0.12476015090942383, 1.2103018760681152 ], "p_value": 0.0081, "mde": 0.51612198792684, "mde_rel_pct": 7.378847993237528, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "predicted": "A negative global dot product between consecutive minibatch gradients resets all integral tensors to zero.", "observed_reset_rate": 0.6267857142857143, "observed_mean_integral_norm": 14.780129302080187, "confirmed": true } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_pi.py", "files": [ "bench_pi.py", "bench_report.json" ], "limitations": "Only the registered tabular track was tested. Vision, sequence, and dynamics were not run. The experiment used 800 training samples, 300 test samples, 20 epochs, global rather than coordinatewise sign detection, and did not measure wall-clock speed or FLOPs.", "system_verdict": "partial", "practical_verdict": "harms", "mechanism_ok": 1, "system_judged": true }