# Стенд-проверка (stage-2) · промт оператора: (универсальный) Ответ агента: { "worked": false, "confidence": 10, "verdict": "Implemented and evaluated the adaptive CBF layer around the shared rnn_small model using bench.train_model, paired seeds, baseline tuning, and a trained-model mechanism signature. The residual-tracking prediction held quantitatively, but adaptive filtering significantly worsened test MSE versus tuned static clipping, so the idea did not win.", "metrics": { "baseline": "Mean test MSE 0.0046574123844038695; best configuration lr=0.01, clip_margin=0.0.", "idea": "Mean test MSE 0.0047074658796191216; best configuration lr=0.01, kappa=0.5; paired delta +0.00005005349521325204; p=0.0081; 0/8 wins.", "mechanism_signature": "Predicted-versus-observed residual MAE 0.000017471262253820896, relative MAE 0.007133921903418612, confirmed=true." }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_adaptive_cbf_bench.py", "files": [ "stage2_adaptive_cbf_bench.py", "bench_report.json" ], "limitations": "The registered dynamics task is supervised pendulum rollout prediction rather than interactive RL, so closed-loop safety violations, return, and intervention-versus-safety Pareto fronts were not measured. Multidimensional QPs, online model retraining, stochastic disturbances, and actuator/environment closed-loop evaluation were not tested.", "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "clip_margin": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "clip_margin": 0.0 }, "mean": 0.008678926387801766 }, { "cfg": { "lr": 0.001, "clip_margin": 0.03 }, "mean": 0.010034722508862615 }, { "cfg": { "lr": 0.001, "clip_margin": 0.08 }, "mean": 0.012918951804749668 }, { "cfg": { "lr": 0.003, "clip_margin": 0.0 }, "mean": 0.006641886895522475 }, { "cfg": { "lr": 0.003, "clip_margin": 0.03 }, "mean": 0.006899000000000001 }, { "cfg": { "lr": 0.003, "clip_margin": 0.08 }, "mean": 0.008067000000000001 }, { "cfg": { "lr": 0.01, "clip_margin": 0.0 }, "mean": 0.005315697111655027 }, { "cfg": { "lr": 0.01, "clip_margin": 0.03 }, "mean": 0.006531292689032853 }, { "cfg": { "lr": 0.01, "clip_margin": 0.08 }, "mean": 0.008570412872359157 } ], "full": { "mean": 0.0046574123844038695, "std": 0.0013966285668353233, "per_seed": [ 0.003739116946235299, 0.004545919597148895, 0.005411764141172171, 0.007565987762063742, 0.004889188800007105, 0.002318228594958782, 0.00456235371530056, 0.004226739518344402 ], "n": 8 } }, "idea": { "mean": 0.0047074658796191216, "std": 0.0014044730096107532, "per_seed": [ 0.003767308546230197, 0.004722419194877148, 0.005457298830151558, 0.007620518561452627, 0.004916135687381029, 0.002345199463889003, 0.004579263739287853, 0.0042515830136835575 ], "n": 8 }, "comparison": { "delta_mean": 5.005349521325204e-05, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 2.819159999489784e-05, 0.0001764995977282524, 4.553468897938728e-05, 5.45307993888855e-05, 2.6946887373924255e-05, 2.6970868930220604e-05, 1.6910023983493806e-05, 2.4843495339155197e-05 ], "p_value": 0.0081, "mde": 4.391403299454989e-05, "mde_rel_pct": 0.9428847903098175, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "selected_idea_cfg": { "lr": 0.01, "kappa": 0.5 }, "baseline_best_cfg": { "lr": 0.01, "clip_margin": 0.0 }, "prediction": "adaptive ebar tracks observed model residual and larger kappa increases intervention", "predicted_vs_observed_mae": 1.7471262253820896e-05, "relative_mae": 0.007133921903418612, "confirmed": true } }, "system_verdict": "partial", "practical_verdict": "harms", "mechanism_ok": 1, "system_judged": true }