Pick-to-Learn Safety Fine-Tuning / report_bench_2026-08-31T155054.md

Failed on benchmark

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 10, "verdict": "Pick-to-Learn safety fine-tuning was evaluated on the registered built-in dynamics track with the matched rnn_small architecture. The complete protocol ran 8 paired seeds, baseline tuning over the shared learning-rate grid, and an equal-size idea sweep. The idea reduced its predicted safety violation rate by 62%, but significantly worsened the independent test MSE, so the benchmark verdict is idea worse (significant) and worked=false.", "metrics": { "baseline": "Uniform MSE baseline, best lr=0.01: mean test MSE 2.8511603204606217e-05 over 8 seeds.", "idea": "Top-8 normalized predicted-angle violation replay, best lr=0.01: mean test MSE 0.10648404061794281 over 8 seeds; predicted violation rate 0.15875 versus baseline 0.4179166666666667; observed held-out violation rate 0.41708333333333336." }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 0.0006690263253403828 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 0.0001483298638049746 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "mean": 2.2257129785430152e-05 } ], "full": { "mean": 2.8511603204606217e-05, "std": 8.769606779676738e-06, "per_seed": [ 1.911987055791542e-05, 1.707040792120248e-05, 3.094019302446842e-05, 2.845365891481898e-05, 2.815296939250752e-05, 2.512051740754117e-05, 4.303032889878638e-05, 3.6205149493511676e-05 ], "n": 8 } }, "idea": { "mean": 0.10648404061794281, "std": 0.01916183881366529, "per_seed": [ 0.08292833715677261, 0.14024589955806732, 0.11994219571352005, 0.12405627220869064, 0.10991806536912918, 0.08748061209917068, 0.08862826228141785, 0.09867268055677414 ], "n": 8 }, "comparison": { "delta_mean": 0.1064555290147382, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0829092172862147, 0.14022882915014634, 0.11991291633421497, 0.1240327133473329, 0.10988793700562383, 0.08745450712376623, 0.08859069369646022, 0.09862741817414644 ], "p_value": 0.0081, "mde": 0.017131317197169284, "mde_rel_pct": 60085.42232518731, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "safety_limit": 0.8, "scale": 0.25, "rows": [ { "seed": 0, "baseline_pred_rate": 0.41, "idea_pred_rate": 0.25333333333333335, "observed_rate": 0.41, "baseline_pred_max_margin": 1.1175339221954346, "idea_pred_max_margin": 0.0780906081199646 }, { "seed": 1, "baseline_pred_rate": 0.43, "idea_pred_rate": 0.0, "observed_rate": 0.43, "baseline_pred_max_margin": 1.0835604667663574, "idea_pred_max_margin": 0.0 }, { "seed": 2, "baseline_pred_rate": 0.43666666666666665, "idea_pred_rate": 0.03333333333333333, "observed_rate": 0.43666666666666665, "baseline_pred_max_margin": 1.0742902755737305, "idea_pred_max_margin": 0.01500558853149414 }, { "seed": 3, "baseline_pred_rate": 0.43666666666666665, "idea_pred_rate": 0.31666666666666665, "observed_rate": 0.43333333333333335, "baseline_pred_max_margin": 1.1583514213562012, "idea_pred_max_margin": 0.08182209730148315 }, { "seed": 4, "baseline_pred_rate": 0.42333333333333334, "idea_pred_rate": 0.14333333333333334, "observed_rate": 0.42333333333333334, "baseline_pred_max_margin": 1.150449514389038, "idea_pred_max_margin": 0.07036739587783813 }, { "seed": 5, "baseline_pred_rate": 0.4166666666666667, "idea_pred_rate": 0.18666666666666668, "observed_rate": 0.4166666666666667, "baseline_pred_max_margin": 1.0507187843322754, "idea_pred_max_margin": 0.08430737257003784 }, { "seed": 6, "baseline_pred_rate": 0.39, "idea_pred_rate": 0.22, "observed_rate": 0.39, "baseline_pred_max_margin": 1.1166901588439941, "idea_pred_max_margin": 0.07752972841262817 }, { "seed": 7, "baseline_pred_rate": 0.4, "idea_pred_rate": 0.11666666666666667, "observed_rate": 0.39666666666666667, "baseline_pred_max_margin": 1.1013514995574951, "idea_pred_max_margin": 0.013077378273010254 } ], "observed_rate_mean": 0.41708333333333336, "predicted_rate_baseline_mean": 0.4179166666666667, "predicted_rate_idea_mean": 0.15875, "predicted_reduction_fraction": 0.6201395812562314, "observed_reduction_fraction": 0.0, "confirmed": false }, "idea_sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "result": { "mean": 0.11110909003764391, "std": 0.013193315288929698, "per_seed": [ 0.09354278445243835, 0.13219793140888214, 0.11154640465974808, 0.1305529773235321, 0.10504380613565445, 0.09625166654586792, 0.10946251451969147, 0.11027463525533676 ], "n": 8 } }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "result": { "mean": 0.11486770864576101, "std": 0.010136738239810605, "per_seed": [ 0.11077549308538437, 0.1312650591135025, 0.11508128046989441, 0.12773503363132477, 0.11910589039325714, 0.0991341769695282, 0.11002153158187866, 0.10582320392131805 ], "n": 8 } }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "result": { "mean": 0.10648404061794281, "std": 0.01916183881366529, "per_seed": [ 0.08292833715677261, 0.14024589955806732, 0.11994219571352005, 0.12405627220869064, 0.10991806536912918, 0.08748061209917068, 0.08862826228141785, 0.09867268055677414 ], "n": 8 } } ], "protocol": { "seeds": [ 0, 1, 2, 3, 4, 5, 6, 7 ], "n_train": 1000, "n_test": 300, "epochs": 18, "batch": 64, "structural_match": "dynamics: controlled pendulum rollout and stability/safety violations", "baseline_method": "uniform per-example MSE", "idea_method": "top-8 normalized predicted-angle violation replay" } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_stage2.py", "files": [ "bench_stage2.py", "bench_report.json" ], "limitations": "Only the registered built-in dynamics supervised pendulum benchmark was tested. The implementation uses predicted angle as a surrogate safety signal rather than a true multi-step closed-loop policy constraint, and the fixed held-out dataset cannot measure policy-induced changes in physical violation frequency.", "system_verdict": "failed", "practical_verdict": "harms", "mechanism_ok": 0, "system_judged": true }