# Стенд-проверка (stage-2) · промт оператора: (универсальный) Ответ агента: { "worked": true, "confidence": 8, "verdict": "The inverse-gain structured GRU significantly outperformed the matched direct-action GRU on the registered inverse_gain_control dynamics track. Test MSE improved from 3.6709986031 to 1.5069266558 on all 8 paired seeds, with permutation p=0.0081; the trained-model mechanism signature confirmed the predicted action-error factorization.", "metrics": { "baseline": "Direct-action GRU, tuned lr=0.003: mean test MSE 3.670998603105545, std 0.63283622936479.", "idea": "Inverse-gain structured GRU, tuned lr=0.003: mean test MSE 1.5069266557693481, std 0.23555139171685704.", "paired_delta": "-2.164071947336197; 8/8 idea wins; permutation p=0.0081." }, "bench_report": { "bench_version": 1, "track": "inverse_gain_control", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 5.920182824134827 }, { "cfg": { "lr": 0.002 }, "mean": 4.574557304382324 }, { "cfg": { "lr": 0.003 }, "mean": 3.198916256427765 } ], "full": { "mean": 3.670998603105545, "std": 0.63283622936479, "per_seed": [ 3.7461042404174805, 3.104163408279419, 2.9681482315063477, 2.9772491455078125, 4.229879379272461, 4.706507682800293, 4.304690361022949, 3.3312463760375977 ], "n": 8 } }, "idea": { "best_cfg": { "lr": 0.003 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 2.0682411789894104 }, { "cfg": { "lr": 0.002 }, "mean": 1.5857862532138824 }, { "cfg": { "lr": 0.003 }, "mean": 1.318423479795456 } ], "mean": 1.5069266557693481, "std": 0.23555139171685704, "per_seed": [ 1.5180333852767944, 1.335729956626892, 1.2053886651992798, 1.2145419120788574, 1.7869166135787964, 1.6817357540130615, 1.8618539571762085, 1.451213002204895 ], "n": 8 }, "comparison": { "delta_mean": -2.164071947336197, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -2.228070855140686, -1.7684334516525269, -1.7627595663070679, -1.762707233428955, -2.4429627656936646, -3.0247719287872314, -2.4428364038467407, -1.8800333738327026 ], "p_value": 0.0081, "mde": 0.3818346490175283, "mde_rel_pct": 10.40138366422991, "verdict": "idea better (significant)", "system_worked": true }, "custom_track": { "name": "inverse_gain_control", "file": "custom_inverse_gain_track.py", "domain": "dynamics" }, "mechanism_signature": { "n_test": 400, "observed_action_error_mean_abs": 0.7880314588546753, "predicted_factor_error_mean_abs": 0.7880314588546753, "slope_observed_on_predicted": 1.0, "correlation": 0.9999999999999957, "relative_residual": 9.462353034450643e-08, "inverse_gain_mae": 0.8039304614067078, "prediction": "action_error=(qhat-q_observed)*z", "confirmed": true } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_run.py", "files": [ "custom_inverse_gain_track.py", "bench_run.py", "bench_report.json", "/home/maxwelhelp/all/math2nn/bench/custom_tracks/inverse_gain_control.py" ], "limitations": "The registered custom track is a small supervised sampled-control benchmark and does not test long-horizon closed-loop stability, sensor-noise robustness, actuator saturation, or hardware transfer. The mechanism signature uses privileged expert targets to infer observed inverse gain and therefore validates the neural-scale factorization rather than deployment-time gain estimation.", "system_verdict": "worked", "practical_verdict": "helps", "mechanism_ok": 1, "system_judged": true }