ISS-CLF/RCBF Neural Policy Shield / report_bench_2026-08-31T193518.md
Failed on benchmark
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "The robust shield was implemented and tested on the structurally matched dynamics track using the shared rnn_small architecture. The independent robust-margin and scalar-QP sanity checks passed, but the trained shield significantly worsened test MSE: baseline mean 0.00141983 versus idea mean 0.00535441, paired delta +0.00393458, permutation p=0.0081. Therefore the idea did not produce a benchmark win, and its neural-scale mechanism signature was not confirmed.", "metrics": { "baseline": "test MSE mean=0.0014198302378645167, std=0.00039839114901047844, best_cfg={"lr":0.01,"wbar":0.05}", "idea": "test MSE mean=0.005354407912818715, std=0.0011548517240013176, best_cfg={"lr":0.01,"wbar":0.05}; paired delta=0.003934577674954198; p_value=0.0081; idea_wins=0/8" }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "wbar": 0.05 }, "sweep": [ { "cfg": { "lr": 0.001, "wbar": 0.05 }, "mean": 0.004298779065720737 }, { "cfg": { "lr": 0.001, "wbar": 0.15 }, "mean": 0.004298779065720737 }, { "cfg": { "lr": 0.001, "wbar": 0.3 }, "mean": 0.004298779065720737 }, { "cfg": { "lr": 0.003, "wbar": 0.05 }, "mean": 0.0034615940821822733 }, { "cfg": { "lr": 0.003, "wbar": 0.15 }, "mean": 0.0034615940821822733 }, { "cfg": { "lr": 0.003, "wbar": 0.3 }, "mean": 0.0034615940821822733 }, { "cfg": { "lr": 0.01, "wbar": 0.05 }, "mean": 0.0014865802077110857 }, { "cfg": { "lr": 0.01, "wbar": 0.15 }, "mean": 0.0014865802077110857 }, { "cfg": { "lr": 0.01, "wbar": 0.3 }, "mean": 0.0014865802077110857 } ], "full": { "mean": 0.0014198302378645167, "std": 0.00039839114901047844, "per_seed": [ 0.0009327387670055032, 0.0018641706556081772, 0.0010785290505737066, 0.0020708823576569557, 0.0009260809747502208, 0.0014055331703275442, 0.0016443432541564107, 0.001436363672837615 ], "n": 8 } }, "idea": { "mean": 0.005354407912818715, "std": 0.0011548517240013176, "per_seed": [ 0.0045272172428667545, 0.004973915405571461, 0.006366239860653877, 0.007458276581019163, 0.005999961402267218, 0.0034331066999584436, 0.005241193808615208, 0.004835352301597595 ], "n": 8 }, "comparison": { "delta_mean": 0.003934577674954198, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0035944784758612514, 0.0031097447499632835, 0.005287710810080171, 0.005387394223362207, 0.005073880427516997, 0.0020275735296308994, 0.003596850554458797, 0.00339898862875998 ], "p_value": 0.0081, "mde": 0.0010030486525361333, "mde_rel_pct": 70.6456747987534, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "chosen_cfg": { "lr": 0.01, "wbar": 0.05 }, "cV": 0.4, "predicted_envelope": "Vdot <= -cV V + disturbance margin", "signature": { "quantity": "mean robust CLF residual versus disturbance", "predicted_slope_abs_theta": 0.7278081178665161, "observed_slope": 0.27696520090103144, "relative_error": 0.6194529845209034, "confirmed": false } } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 math_sanity.py && /home/maxwelhelp/main/bin/python3 bench_shield.py", "files": [ "bench_shield.py", "math_sanity.py", "bench_report.json" ], "limitations": "The benchmark evaluates supervised next-angle prediction rather than closed-loop RL return or deployed action-level QP control. The local intervention uses a scalar Euler-derived shield surrogate rather than a production differentiable QP solver; no PPO/SAC training or deployment-time safety-violation metric was tested.", "system_verdict": "failed", "practical_verdict": "harms", "mechanism_ok": 0, "system_judged": true }