Noise-Whitened Trajectory-KL Policy Regularization / report_bench_2026-08-31T163009.md
Failed on benchmark
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "The noise-whitened drift penalty was implemented as a training-loss modification on the structurally matched dynamics track using the shared rnn_small model. The tuned baseline outperformed the best idea configuration: baseline MSE 1.38641318e-05 versus idea MSE 1.48492650e-05, paired delta +9.85133170e-07 and permutation p=0.0956. The mechanism signature was not confirmed, so this is not a win.", "metrics": { "baseline": "lr=0.01, reg=0.03; mean=1.3864131801710755e-05, std=2.917053139718998e-06", "idea": "lr=0.01, reg=0.03; mean=1.4849264971417142e-05, std=2.2583458302260994e-06", "paired_delta": 9.85133169706387e-07, "permutation_p": 0.0956 }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "reg": 0.03 }, "sweep": [ { "cfg": { "lr": 0.001, "reg": 0.03 }, "mean": 0.000516663167218212 }, { "cfg": { "lr": 0.001, "reg": 0.1 }, "mean": 0.0005222226318437606 }, { "cfg": { "lr": 0.001, "reg": 0.3 }, "mean": 0.0005512491334229708 }, { "cfg": { "lr": 0.003, "reg": 0.03 }, "mean": 5.068586688139476e-05 }, { "cfg": { "lr": 0.003, "reg": 0.1 }, "mean": 5.551056983676972e-05 }, { "cfg": { "lr": 0.003, "reg": 0.3 }, "mean": 8.239948328991886e-05 }, { "cfg": { "lr": 0.01, "reg": 0.03 }, "mean": 1.4466989341599401e-05 }, { "cfg": { "lr": 0.01, "reg": 0.1 }, "mean": 1.7228220713150222e-05 }, { "cfg": { "lr": 0.01, "reg": 0.3 }, "mean": 3.9540235775348265e-05 } ], "full": { "mean": 1.3864131801710755e-05, "std": 2.917053139718998e-06, "per_seed": [ 1.2164169675088488e-05, 1.9545861505321227e-05, 1.0918912266788539e-05, 1.5239013919199351e-05, 1.629439248063136e-05, 1.428560062777251e-05, 1.23286408779677e-05, 1.0136463060916867e-05 ], "n": 8 } }, "idea": { "mean": 1.4849264971417142e-05, "std": 2.2583458302260994e-06, "per_seed": [ 1.3598252735391725e-05, 1.7523587303003296e-05, 1.194078413391253e-05, 1.765600791259203e-05, 1.7466716599301435e-05, 1.4715534234710503e-05, 1.3851561561750714e-05, 1.2041675290674902e-05 ], "n": 8 }, "comparison": { "delta_mean": 9.85133169706387e-07, "idea_wins": 1, "n_pairs": 8, "per_seed_diffs": [ 1.4340830603032373e-06, -2.0222742023179308e-06, 1.0218718671239913e-06, 2.41699399339268e-06, 1.1723241186700761e-06, 4.299336069379933e-07, 1.5229206837830134e-06, 1.9052122297580354e-06 ], "p_value": 0.0956, "mde": 1.1296557285196537e-06, "mde_rel_pct": 8.148045219681629, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "prediction": "inverse covariance weights low-noise drift more than high-noise drift", "low_high_weighted_cost_ratio_observed": 0.8153622015675527, "confirmed": false, "models": [ { "kind": "baseline", "raw_drift_cost": 0.0008920590626075864, "whitened_drift_cost": 0.002272645477205515 }, { "kind": "idea", "raw_drift_cost": 0.000797593267634511, "whitened_drift_cost": 0.00203404831700027 } ] } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_bench.py", "files": [ "stage2_bench.py", "bench_report.json" ], "limitations": "The built-in dynamics track is a forecast task rather than an explicit policy-rollout environment with learned drift and diffusion models. The implementation therefore used predicted theta minus persistence-reference theta as a differentiable drift proxy and a state-dependent proxy variance; PPO/SAC interaction, offline behavior policies, finite-horizon trajectory KL, and larger models were not tested.", "system_verdict": "failed", "practical_verdict": "inconclusive", "mechanism_ok": 0, "system_judged": true }