# Стенд-проверка (stage-2) · промт оператора: (универсальный) Ответ агента: { "worked": false, "confidence": 9, "verdict": "Implemented and evaluated a custom complex-array channel regression track with matched MLP encoders and an analytic rank-one steering-atom decoder. The idea's best result was MSE 0.0076194 versus baseline 0.0067185; paired delta was +0.0009009 and the permutation p-value was 0.0081, yielding the significant-worse verdict. The analytic decoder therefore did not produce a neural-training win in this benchmark.", "metrics": { "baseline": "Tuned learned-output MLP, lr=0.01: full 8-seed MSE 0.0067185 ± 0.000713", "idea": "Analytic K=2 steering-atom MLP, lr=0.01: full 8-seed MSE 0.0076194 ± 0.000828; paired delta +0.0009009, p=0.0081" }, "how_to_run": "/home/maxwelhelp/main/bin/python3 run_bench.py", "files": [ "array_track.py", "run_bench.py", "bench_report.json" ], "limitations": "The custom track uses 8x8 synthetic two-path channels, not a real wireless dataset or 32x32/48x48 transfer. It does not test quantization, variable active-slot masking, rate-vs-error curves, decoder FLOPs, or learned off-grid offsets/Taylor decoding; K was fixed at 2. The reported Taylor signature is an analytic steering-vector probe alongside a trained-model output RMS, not a robust learned-coordinate behavioral test, so it should not be treated as independent mechanism confirmation.", "bench_report": { "bench_version": 1, "track": "complex_array_channel", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "k": 2 }, "sweep": [ { "cfg": { "lr": 0.001, "k": 2 }, "mean": 0.007402819930575788 }, { "cfg": { "lr": 0.003, "k": 2 }, "mean": 0.0065840884344652295 }, { "cfg": { "lr": 0.01, "k": 2 }, "mean": 0.006486733560450375 } ], "full": { "mean": 0.006718522927258164, "std": 0.0007129592821712252, "per_seed": [ 0.006483251228928566, 0.00544784078374505, 0.007208648603409529, 0.006807193625718355, 0.007167691830545664, 0.007836345583200455, 0.005902399308979511, 0.006894812453538179 ], "n": 8 } }, "idea": { "mean": 0.007619430776685476, "std": 0.0008275326682381549, "per_seed": [ 0.0074270921759307384, 0.006459011230617762, 0.008539552800357342, 0.007304489612579346, 0.007882530800998211, 0.00901730451732874, 0.006567466538399458, 0.007757998537272215 ], "n": 8 }, "comparison": { "delta_mean": 0.0009009078494273126, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0009438409470021725, 0.0010111704468727112, 0.001330904196947813, 0.0004972959868609905, 0.0007148389704525471, 0.0011809589341282845, 0.0006650672294199467, 0.0008631860837340355 ], "p_value": 0.0081, "mde": 0.0002304888187870338, "mde_rel_pct": 3.43064720151363, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "prediction": "Taylor steering error scales quadratically in offset", "delta": 0.001, "predicted_error_order": 2.0, "observed_error_over_delta_squared": 34.418742870911956, "trained_model_output_rms": 0.011084591038525105, "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.001, "k": 2 }, "mean": 0.007869121560361236, "std": 0.0008392636492011609 }, { "cfg": { "lr": 0.003, "k": 2 }, "mean": 0.007681989867705852, "std": 0.0008145156626225875 }, { "cfg": { "lr": 0.01, "k": 2 }, "mean": 0.007619430776685476, "std": 0.0008275326682381549 } ], "custom_track": { "name": "complex_array_channel", "file": "array_track.py", "domain": "array-valued complex low-rank tensors" } }, "system_verdict": "partial", "practical_verdict": "harms", "mechanism_ok": 1, "system_judged": true }